RealReplicaBench 把一个刺眼的问题摆到了台面上:顶级模型已经能在不少考试型任务里拿高分,但一旦进入真实电商后台、软件界面和连续操作流程,Agent 的成功率仍然不稳。107 个真实工作任务中,领先模型也只是刚过六成,许多模型还不到一半。这不是简单的“模型还不够聪明”,而是 AI 从回答问题走向代办工作时,正在遇到界面理解、状态记忆、工具调用、权限边界和失败恢复的综合考验。
同一批重点资讯里,OpenRouter 被 Stripe 以超过 70 亿美元收购,奥特曼谈到下一代 ChatGPT 将覆盖更完整的个人工作上下文,Vinci2 试图让第一视角助手学会主动服务,GenBio AI 则把多尺度生命系统搬进数字有机体框架。几条新闻放在一起看,AI 竞争的焦点正在从“单个模型能不能答对”,转向“系统能不能理解场景、调度模型、持续记忆并在可控边界内完成任务”。
真实工作更难
很多 Agent 演示看起来顺滑,是因为任务被拆得足够清楚,环境也足够友好。真实工作场景完全不同:按钮位置会变,页面会弹窗,数据表有分页,账号权限有差异,用户目标还可能在执行过程中改变。模型只要错过一个状态、误点一个入口,后面的步骤就会连锁偏离,最后看似完成了任务,实际结果却不可用。
RealReplicaBench 的价值正在于它不只问模型“知不知道答案”,而是让模型真正进到接近生产环境的流程里做事。电商任务里常见的商品编辑、订单处理、库存查看、营销设置,本质上都是多步骤、强状态、带业务约束的任务。模型需要先理解用户意图,再观察界面反馈,还要在操作失败时回退和重试。通过率偏低说明 Agent 的短板不在一句回答,而在连续执行。
路由层变贵
OpenRouter 被 Stripe 收购,表面看是支付公司买下模型调用入口,实质上是 AI 应用层开始重视“模型路由”这门生意。开发者不会永远只调用一个模型:有的任务需要强推理,有的任务只要低成本生成,有的任务看重多模态,有的任务要求稳定延迟。统一接口、计量计费、故障切换和供应商管理,会变成 AI 应用能否规模化运行的基础设施。
这和 Agent 成功率低的问题直接相关。一个真实任务往往不是单模型一口气完成,而是需要拆成规划、检索、执行、校验、总结等环节。不同环节适合不同模型和工具,系统还要根据成本、速度、可用性动态选择。OpenRouter 这类路由平台的价值,就在于把模型供应商从“单点能力”组织成可调度的资源池。

上下文成入口
奥特曼提到下一代 ChatGPT 将在更大范围内理解用户的工作和生活上下文,这个方向并不意外。Agent 做不好真实任务,很大一部分原因是它看到的信息太碎:只知道当前提示词,不知道用户长期偏好;能读一段文档,却不知道会议里的隐含约定;能操作一个页面,却不知道这个任务在公司流程里意味着什么。
如果 AI 助手能持续理解屏幕、会议、通话、文档和历史决策,它就更可能从“被动问答”变成“主动补位”。但这也带来新的边界问题:上下文越完整,隐私、权限、误操作和数据留存风险越高。企业用户会关心哪些信息可以被读取,哪些任务需要人工确认,哪些操作必须留下审计记录。全上下文助手要真正落地,不能只强调聪明,还要证明自己可控。
主动服务抬头
Vinci2 把第一视角 AI 助手从“有问必答”推向“判断何时主动开口”,这条路线很关键。真实工作里,用户并不总能准确提出问题。有时 AI 应该在看到异常数据时提醒,在会议里发现遗漏事项时补充,在流程卡住时建议下一步。主动性如果做得好,AI 就不是等待指令的工具,而是能降低认知负担的协作对象。
难点在于主动服务很容易越界。提醒太少,用户感受不到价值;提醒太多,又会变成噪音。系统需要判断场景重要性、用户忙闲状态、任务风险和建议置信度。Vinci2 这类研究把“何时开口”形式化为评测任务,说明行业已经意识到,未来助手的竞争不只是生成内容,还包括时机判断和交互分寸。
行业应用加速
GenBio AI 提出 AI 驱动的数字有机体,把分子、细胞、组织、器官等不同尺度模型整合起来,用计算机模拟生命系统。这类新闻和通用 Agent 看似距离很远,其实说明同一个趋势:AI 正在从通用聊天能力,进入对专业系统的建模。生命科学、药物研发、医疗影像、工业设计和企业流程,都需要模型理解复杂对象之间的关系,而不是只会生成一段流畅文字。
AI 漫剧工具、图像生成模型、水印移除项目和模型评测黑客松则代表另一面。内容生产门槛继续下降,用户对模型能力的评估也越来越草根化。爆款短剧可以由少数人借助多个 Agent 快速完成,普通用户也开始用自制评测集判断模型好不好用。行业应用和娱乐玩法同时扩散,会让 AI 更快进入大众场景,也会放大版权、真实性和责任归属问题。
落地看三件事
接下来判断 AI Agent 是否真正成熟,不能只看模型榜单。第一要看任务完成率,尤其是在真实软件、真实权限、真实数据里的完成率;第二要看系统调度能力,能否在多个模型、工具和数据源之间稳定切换;第三要看边界治理,能否把隐私、确认、审计和失败回滚做进产品,而不是把风险留给用户自己承担。
这也是 OpenRouter、全上下文助手、主动服务研究和真实工作评测同时变热的原因。AI 已经不缺会说话的模型,缺的是能进入复杂环境持续办事的系统。谁能把模型能力、上下文记忆、路由基础设施和安全边界组织起来,谁才更可能拿到下一阶段的工作流入口。







