排序
Agent真实工作通过率偏低,模型路由和全上下文助手成了新焦点
RealReplicaBench 把一个刺眼的问题摆到了台面上:顶级模型已经能在不少考试型任务里拿高分,但一旦进入真实电商后台、软件界面和连续操作流程,Agent 的成功率仍然不稳。107 个真实工作任务中...
万相Wan3.0模型上线、小米发布玄戒O3等AI芯片后,AI应用竞争开始回到真实入口
这一天的 AI 行业动态有一个共同指向:AI 大模型不再只围绕参数、榜单和演示视频竞争,而是在代码开发、内容生产、办公入口、终端设备、商业化结算和安全治理里寻找真实落点。万相Wan3.0视频生...
Claude绑定AWS算力,AI竞争从模型榜单转向系统交付
Anthropic 与亚马逊锁定大规模 AWS 算力,SubQ 长上下文、Gemma 推理提速和企业部署同步升温,AI竞争正从模型榜单转向算力、效率和系统交付。
Anthropic工作型智能体浮出水面,AI开始进入常驻流程
Anthropic 的工作型智能体浮出水面 TestingCatalog 从 Claude 代码和隐藏界面中发现的 Conway、Orbit、Operon、BugCrawl 等产品线,把 Anthropic 下一步的产品方向勾勒得很清楚:大
Astra突破数学开放问题后,AI科研开始进入可验证时代
OpenAI Astra 被曝在数学开放问题上取得突破,形式化验证、科研 Agent 与企业应用共同说明,AI 竞争正在从单点能力展示走向可验证的复杂任务系统。






