EvoX把多智能体蜂群的答题正确率推到70%以上,ClawBench却在真实网站上给出另一幅画面:表现最好的Claude Sonnet 4.6完成率只有33.3%,GPT-5.4仅为6.5%,还有68项任务没有任何模型通过。两组结果并不互相否定,反而共同揭开了Agent产业最关键的矛盾——实验室里更聪明的协作方式,到了真实系统中仍会被页面变化、权限确认、状态丢失和最后一步操作拖住。
这意味着,评价Agent不能只看它是否会拆任务、会调用工具,也不能只盯着一次演示是否成功。真正能进入办公、研发和企业服务的智能体,必须在长时间执行中保留上下文,知道何时并行、何时停下,遇到异常能够恢复,并把最终动作交给可验证的机制。页面上的一个按钮、一次权限弹窗或一条没有及时写回的状态,都可能让前面的推理全部失去价值。Agent竞争正在从“能不能做”转向“能不能稳定做完”。
70%是怎么来的
EvoMap发布的桌面Agent产品EvoX采用去中心化蜂群组织方式,让多个Agent平级分工,再按照任务编号直接汇合结果,减少由一个总Agent反复转述造成的信息损耗。使用同一模型Claude Haiku 4.5回答563道题时,EvoX蜂群正确率达到70.69%至70.87%,明显高于单Agent的26.29%和传统Sub-Agent方式的38.54%。这说明,组织结构本身就能显著放大模型能力。
它的另一项价值是保存已经跑通的方法,后续遇到类似任务时直接复用。模型参数没有变化,但任务分工、经验沉淀和结果汇合方式发生了变化,系统就能少走弯路。对企业而言,这比单纯更换一个更大的模型更现实:成熟流程可以逐步积累,验证过的步骤可以成为资产,失败案例也能转化为下一次执行的约束。
真实网站为何失灵
ClawBench把智能体放进144个真实网站,要求完成153项任务。Claude Sonnet 4.6的完成率为33.3%,GPT-5.4只有6.5%,68项任务全部模型零通过。最典型的问题不是模型完全看不懂页面,而是它已经走到流程末端,却因为不确定按钮后果、担心越权或无法确认提交状态,停在了最后一步。
真实网站远比封闭测试环境复杂。弹窗可能遮住按钮,登录状态可能失效,同一功能在不同账号下会显示不同界面,提交之后还可能遇到验证码、二次确认或网络延迟。模型即使规划正确,只要没有持续观察页面变化、核对操作结果,就可能把“点击过”误当成“完成了”。因此,真实交付率考验的是感知、权限、状态和验证组成的整套系统,而不只是语言模型的推理分数。
记忆不是无限上下文
OpenAI为Codex CLI更新记忆机制,放弃把旧对话不断压缩进同一个上下文窗口,改用硬切窗口、工作注释和历史查询三部分。当窗口接近上限时,Agent带着交接材料进入新窗口,完整对话档案则保留下来供查询。这种设计承认了一个现实:长任务不可能依靠无限增长的上下文硬撑,关键是把当前状态、已完成工作和下一步计划交接清楚。
传统压缩容易丢掉细节,尤其是文件路径、失败原因、用户限制和已经验证过的结论。一旦这些信息被模糊概括,后续Agent就可能重复操作或重新犯错。工作注释相当于任务现场的交接单,历史查询则让系统在需要时回看证据。对企业工作流来说,记忆的价值不是“什么都记住”,而是能够在正确时刻找回与当前动作直接相关的信息。

工程化比堆数量更重要
多Agent系统正在形成所谓Graph Engineering:任务图负责描述工作如何拆解与依赖,Agent图定义不同角色之间怎样协作,状态图记录执行到了哪里、哪些节点成功、哪些节点需要重试。三类图把原本藏在对话里的协作关系变成可观察结构,系统也更容易实现并行执行、状态共享和失败恢复。
这恰好解释了EvoX高分与ClawBench低完成率之间的距离。蜂群能够提高搜索和推理覆盖面,但Agent数量越多,重复调用、权限冲突和结果覆盖也越容易出现。如果没有任务编号、状态锁、验收节点和回滚策略,更多Agent只会制造更多噪声。企业需要的不是一群同时说话的机器人,而是一条每个步骤都有负责人、输入、输出和验收标准的执行链。
从答题走向结果收费
百融智能的企业级Agent提供了另一种观察尺度。其硅基员工进入物流、券商等场景后,物流日处理量从不足1000通提升到1.5万通,券商部署规模从30席扩至210席,物流单次处理成本较传统人工降低50%以上。公司采用RaaS按结果收费,客户为实际完成的任务付费,而不是为模型调用次数买单。
按结果收费会倒逼系统解决“最后一公里”。一次对话看起来流畅没有意义,只有工单是否关闭、资料是否写回、异常是否转人工、结果是否可追溯,才能形成收入。部署这类业务时,云服务器需要为任务队列、日志、数据库和权限服务提供稳定运行环境;选择速维云等基础设施时,更应关注持续可用性、网络质量、备份与监控,而不是只比较单次模型响应速度。
可验证才是分水岭
Agent下一阶段的核心指标,应从单轮正确率扩展到端到端完成率、人工接管率、失败恢复时间、重复执行比例和单位成功任务成本。对于会产生外部影响的动作,还应设置分级权限:查询和草拟可以自动完成,发送、支付、删除或正式提交则需要明确授权,并在执行后回读结果。这样既不会因为过度谨慎让Agent永远停在最后一步,也不会为了追求完成率而牺牲安全。
EvoX证明组织方式可以让同一个模型变得更强,ClawBench则提醒行业,真实世界不会按照测试题的规则配合智能体。Codex的新记忆机制、Graph Engineering和按结果收费的企业实践,正在从不同方向补齐这段距离。未来真正有竞争力的Agent,不是最会展示推理过程的那个,而是能够保存状态、控制权限、验证结果,并在失败后继续把任务做完的系统。





