EvoMap 张昊阳提出的 EvoX 蜂群模式,把 Agent 协作这件事从“多开几个模型窗口”推进到更接近工程系统的层面。测试里,同一模型 Claude Haiku 4.5 面对 563 道题,单 Agent 正确率只有 26.29%,传统 Sub-Agent 模式提升到 38.54%,而 EvoX 蜂群达到 70.69%。这个跨度足够说明:Agent 的下一轮竞争,未必只靠更大的模型,而要看任务怎么拆、上下文怎么隔离、经验怎么沉淀、结果怎么汇总。
这条消息也和近期 Cursor 的 AI 蜂群系统、Claude Code 删除大量系统提示词、腾讯 E-GRM 让模型“拿不准才多想”、企业压缩无效 AI 采购等动态形成呼应。行业正在从“让一个模型尽量聪明”,转向“让一组模型稳定协作”。如果说过去的大模型产品像一个全能助手,那么现在的 Agent 系统更像一支能分工、能交接、能复盘的数字团队。
蜂群不是简单群聊
EvoX 最值得看的地方,是它没有把多 Agent 协作理解成“把问题发给几个智能体,再让大模型总结答案”。传统做法常见的问题是,子任务之间边界不清,多个 Agent 的上下文互相污染,最后汇总时又由另一个大模型重新整理,信息在传递中被压缩、误解甚至丢失。看起来很热闹,实际效果可能只是把一个模型的犹豫变成一群模型的噪音。
EvoX 的思路更工程化:先把任务彻底拆分,让不同 Agent 在独立上下文里处理局部问题,再用程序直接汇总结果,而不是让模型凭感觉二次概括。这个设计把“协作”从聊天范式拉回工作流范式。每个 Agent 更像一个受约束的执行单元,只关心自己负责的部分;系统层则负责组织、校验和组合。正确率从 26.29% 拉到 70.69%,关键并不是模型突然变聪明,而是系统减少了无效沟通和上下文损耗。
上下文隔离变成核心能力
Agent 长任务失败,很多时候不是模型不会,而是上下文被塞得太乱。一个复杂任务里既有目标、限制、历史尝试、外部资料、工具输出,又有中间结论和错误路径。如果全部堆进同一个上下文窗口,模型会在信息海里反复摇摆,既容易忘记关键约束,也容易把临时想法当成最终事实。EvoX 强调独立上下文隔离,本质上是在给不同工作单元建立“干净房间”。
这和 Claude Code 删除 80% 以上系统提示词的趋势很像。强推理模型不一定需要保姆式提示词,但它需要更清晰的边界、更少的噪音和更可靠的材料组织方式。过去很多 Agent 产品试图用越来越长的系统提示词解决执行问题,结果提示词像规章制度一样越堆越厚。现在更有效的方向可能是:让模型少背规则,让系统把任务、资料、工具和权限切成更清楚的结构。

程序汇总降低信息损耗
多 Agent 系统里最容易被低估的环节,是最后的汇总。许多方案会让一个“总指挥模型”阅读多个子 Agent 的回答,再写出最终结论。这听起来自然,但问题也明显:模型会删掉它认为不重要的细节,会把不确定结论写得很确定,也可能为了表达顺滑而重新编排事实。子 Agent 辛苦找出的证据和边界条件,可能就在总结阶段被磨平。
EvoX 用程序直接汇总,代表一种更可靠的方向。凡是可以结构化的内容,就尽量交给程序处理;凡是需要判断的部分,再交给模型。这样做的意义在于,把模型从“既负责创造又负责记账”的角色里解放出来。Agent 系统越复杂,越需要这种分层:模型负责理解、推理、生成和局部决策,程序负责调度、校验、排序、去重和合并。两者边界越清楚,系统稳定性越高。
AI协作开始自组织
EvoX 的另一个有趣结果,是 24 个 Agent 的自组织实验。研究中,当 Agent 能看到彼此能力信息后,它们会自主选择更合适的合作对象。这说明多 Agent 协作不只是预设流程,也可能逐渐演化出任务匹配机制。未来的 Agent 系统,也许不会一直由人类写死“谁先做、谁后做、谁检查”,而是根据任务类型、历史表现和当前资源,动态组成临时小队。
这会改变企业使用 AI 的方式。一个营销任务可能自动拆成资料检索、用户画像、竞品分析、文案生成、合规检查和投放复盘;一个研发任务可能拆成需求理解、代码修改、测试补齐、文档更新和回归验证;一个客服任务可能拆成意图识别、订单查询、政策匹配和风险判断。真正有价值的不是“某个 Agent 很会说”,而是整套系统能不能把不同能力放到正确位置。
Cursor与Agent工程化呼应
Cursor 近期发布的 AI 蜂群系统研究,也在证明类似方向。它用“规划器+执行者”架构,尝试根据 835 页 SQLite 文档重建数据库。这个案例很极端,但正因为极端,才暴露了单 Agent 的上限:一个模型很难同时长期保持全局规划、细节执行、测试修复和架构一致性。把任务拆给多个执行者,再由规划层持续推进,才更接近真实软件工程。
从成本数据看,Cursor 的系统也提醒行业,多 Agent 不是免费的魔法。蜂群可以提升完成率,也可能带来更高 token 消耗、更多工具调用和更复杂的失败排查。企业部署 Agent 时,不能只看演示里的“自动完成”,还要看单位任务成本、失败回滚机制、日志可追踪性和权限边界。未来的胜负手,可能不是谁能开最多 Agent,而是谁能用最少的协作成本完成最稳定的交付。
企业AI需要结果闭环
这也解释了为什么部分企业开始砍掉无效 AI 采购。业务部门用 AI 生成更多 PPT、更多报告、更多素材,如果没有转化为收入、效率、质量或风险控制,老板看到的只是 token 成本和工具订阅费。AI 落地从来不只是“员工有没有用”,而是要看它有没有进入关键流程,并对结果负责。Agent 蜂群的价值,必须体现在任务闭环,而不是停在炫技层。
对企业来说,EvoX 这类研究的启发是:不要急着把所有员工都塞进一个聊天机器人里,而要先找出工作中可拆分、可校验、可复盘的流程。比如资料整理、代码审查、客服质检、投标文档、内容审核、运维排障和销售线索跟进,都比泛泛的“智能助手”更适合做 Agent 化改造。AI 只有接住真实任务,才有机会从效率工具变成生产系统。
模型竞争转向系统竞争
过去大模型竞争经常围绕榜单分数、上下文长度和价格展开,但 Agent 时代会把更多变量拉进来。模型当然仍然重要,推理能力、工具调用能力、代码能力和长上下文稳定性都会影响上限;但系统设计会决定下限。任务拆不好,强模型也会乱;上下文隔离不清,长窗口也会变成垃圾场;汇总机制不可靠,多 Agent 反而会制造更多幻觉。
因此,EvoX 的意义不只是一个正确率数字,而是提醒行业:AI 协作正在从产品包装词变成工程问题。未来的优秀 Agent 平台,应该能管理角色、上下文、工具、权限、成本、日志和评估,而不是只提供几个“智能体模板”。当模型能力逐渐普及,真正稀缺的会是把模型组织成可靠工作系统的能力。
下一步看经验如何流通
张昊阳提出让 Agent 经验像基因般流通,这个比喻也很关键。今天许多 Agent 失败后,经验不会沉淀:这次踩过的坑,下次换个任务还会再踩;这个项目里摸索出的流程,换个上下文又要重新学习。如果经验能够被结构化记录、筛选、复用和演化,Agent 系统才会从“一次性执行器”变成可成长的组织。
当然,这里面也有风险。经验流通需要判断哪些经验可靠、哪些只是偶然成功;需要避免把错误模式固化成规则;还要处理隐私、权限和数据隔离问题。真正成熟的 Agent 蜂群,不会只是会合作,还要会遗忘、会纠错、会审计。EvoX 给出的方向已经很清楚:下一阶段 AI 的重点,不只是训练更强的个体,而是设计更会协作、更能复盘、更可控的群体。







暂无评论内容