OpenAI 这次把 ChatGPT 前端和 Codex 多智能体能力一起推到台前,信号比单纯“模型又强了”更直接:AI 产品竞争正在从回答质量,转向响应速度、上下文调度、任务拆分和执行成本的系统能力。应用加载速度提升 94%、堆内存增长降低 87.8%、网络请求数下降 98.2%,这些数字看起来偏工程细节,但对高频用户和企业团队来说,恰恰决定 AI 能不能像日常工具一样稳定打开、持续使用、快速进入工作状态。
更值得关注的是 Codex 上线 GPT-5.6 多智能体 V2。主 Agent 可以自动把子任务委派给不同模型,用户不用反复判断该选哪个模型、该给多少推理强度、该不该拆分任务。模型能力仍然重要,但真正影响生产力的,开始变成系统如何把模型、任务、缓存、工具和成本组织起来。
速度进入核心指标
过去大模型发布常把重点放在跑分、上下文长度和推理能力上,用户也习惯用“聪不聪明”评价一个 AI 产品。但当 AI 助手进入写代码、查资料、整理文档、审查变更和协作办公等高频场景后,速度会变成基础体验。页面迟迟打不开、历史对话加载卡顿、长会话占用内存过高,都会让用户在真正开始工作前先消耗耐心。
OpenAI 这次强调前端性能,说明 ChatGPT 已经不是偶尔问答的实验入口,而是在向长期工作台演进。加载速度提升 94% 不只是“打开更快”,还意味着复杂对话、插件、文件、项目和多工具交互需要更轻的客户端架构。堆内存增长降低 87.8%,则直接关系到长时间使用时浏览器是否越来越卡、团队成员能不能把它当成常驻工具。
多智能体开始接管调度
Codex 的多智能体 V2 更像是这次更新的真正主菜。软件开发任务天然适合拆分:一个任务需要读代码、定位问题、修改实现、补测试、解释变更,还可能要同时比较多个方案。过去用户往往需要手工拆任务,或者在不同模型之间来回切换,成本和注意力都浪费在调度上。
主 Agent 自动委派子任务后,AI 编程工具的形态会发生变化。用户提出目标,系统判断哪些部分需要更强推理,哪些部分适合低成本模型,哪些工作可以并行处理,哪些结果需要合并校验。这样一来,模型选择从“用户的使用技巧”变成“系统的内部能力”,开发者真正关心的是最终变更是否可靠、解释是否清楚、测试是否跟得上。

成本也被重新计算
多智能体并不天然省钱。如果每个子任务都调用高推理模型,成本可能比单 Agent 更高。OpenAI 提到降低推理成本,关键就在于让系统用更细的颗粒度分配计算资源:简单检索、格式整理、低风险修改可以交给成本更低的模型,架构判断、安全审查和复杂推理再交给更强模型。
这与开发者最近对 Claude Code 使用成本的讨论互相呼应。Anthropic 公开提醒用户用缓存、文件引用、清理上下文和 subagent 隔离任务来省 Token,本质上说明 Agent 工具已经进入“成本工程”阶段。企业不是只看一次回答价格,而是会计算一个研发团队每天跑多少任务、消耗多少上下文、节省多少审查和沟通时间。
开发者生态同步升温
同一批资讯里,DeepSeek Harness 的插件热度也值得放在一起看。它以“一切皆插件”为核心,把模型、工具、界面和任务能力拆成可组合模块,短时间内吸引大量开发者围绕插件生态做扩展。OpenAI 的多智能体调度偏产品内核,DeepSeek Harness 的插件化偏开放生态,两者方向不同,但都在回答同一个问题:AI 能不能被组织成可持续扩展的工作系统。
这也是 Agent 竞争从聊天框向执行层下沉的原因。一个成熟的 Agent 产品不能只会生成文本,还要会调用工具、读取项目、保持上下文、拆解任务、合并结果,并在失败时给出可追踪的原因。插件生态负责扩大能力边界,多智能体调度负责把能力组织起来,二者会共同影响开发者最终选择哪个平台作为日常入口。
应用落地不只在编程
苹果与阿里共同训练面向中国市场的专属模型,则提醒行业另一条主线:AI 能力正在进入更靠近终端用户的系统层。端侧 30 亿参数、云端 200 亿参数、多模型协同和算法备案,说明手机厂商要做的不是简单接一个聊天接口,而是把模型嵌入操作系统、隐私边界、本地能力和云端服务之间。
清华 AIR 与伯克利提出连续世界模型 ODEWorld,则把视角带到机器人。机器人不再逐帧猜下一帧,而是学习环境随物理时间连续变化,真机任务成功率从 55% 提升到 80%。这说明 AI 落地正在分化:软件 Agent 追求任务调度和工具执行,手机 AI 追求系统入口和本地体验,机器人 AI 追求对真实世界变化的连续理解。
竞争焦点发生转移
CodeRabbit 融资、Anthropic 营收高增、端侧推理公司拿到新资金,这些消息共同指向一个变化:资本和客户正在把钱投向能产生实际流程价值的位置。代码审查、企业自动化、手机系统入口、机器人控制、端侧推理和开发者插件,都是把模型能力转成真实效率的中间层。
OpenAI 这次更新的意义也在这里。它不是单独发布一个更会聊天的模型,而是在补齐 AI 工作台的工程底座。当前沿模型能力越来越接近,用户会更敏感地比较谁更快、谁更稳、谁更会拆任务、谁更省钱、谁能把结果放进真实工作流。接下来 AI 产品的胜负,很可能不只由模型参数决定,而由执行系统决定。
对企业用户来说,这种转移会改变采购和落地方式。过去评估 AI 工具,常常让员工试用几天,看回答是否顺手;接下来更需要看它能否接入权限体系、能否记录任务链路、能否解释每个子任务由谁完成、能否在成本异常时及时收敛。速度、调度、治理、预算控制和故障追踪,会和模型能力一起进入同一张评估表,决定它能不能从个人效率工具升级为团队基础设施。






