最新发布第127页
排序
Agent真实工作通过率偏低,模型路由和全上下文助手成了新焦点
RealReplicaBench 把一个刺眼的问题摆到了台面上:顶级模型已经能在不少考试型任务里拿高分,但一旦进入真实电商后台、软件界面和连续操作流程,Agent 的成功率仍然不稳。107 个真实工作任务中...
OpenAI暂停高风险训练后,AI竞争开始重算安全、开源和算力底座
OpenAI 暂停下一代旗舰模型的强化学习训练,这个动作比单纯的新模型传闻更值得盯。它说明前沿模型公司已经开始把能力上限、安全边界和算力调度放到同一张表里计算:模型越接近高风险能力区,继...
谷歌把 Gemma 4 推快 3 倍后,本地大模型开始拼执行效率
Gemma 4 通过 Multi-Token Prediction 将推理速度最高提到 3 倍,SubQ 也把超长上下文和低成本一起往前推,AI 产品竞争正在从会说转向会做。
Claude绑定AWS算力,AI竞争从模型榜单转向系统交付
Anthropic 与亚马逊锁定大规模 AWS 算力,SubQ 长上下文、Gemma 推理提速和企业部署同步升温,AI竞争正从模型榜单转向算力、效率和系统交付。









