百万上下文放开后,大模型竞争开始转向记忆和执行层

OpenAI 把 Codex 的百万上下文放开后,最值得盯的不是又多了一个参数,而是模型开始被迫承担更长、更连续、更接近真实工作的状态。过去大模型的优势常常停留在“这一问回答得好不好”,现在问题变成“它能不能记住前面的约束、延续前面的判断,并在多轮动作里不丢线索”。

Modern architectural view of Taipei Medical University with fountain feature outdoors.

这件事看起来像接口升级,实质上是在重写 AI 产品的工作方式。长上下文不是万能记忆,但它会把模型从一次性问答推向持续任务,从短促回应推向长链路执行。对开发者、企业和重度用户来说,这种变化比单纯的参数增长更直接,因为它影响的是任务能不能真正做完。

百万上下文

OpenAI 通过 Tibo 放开 Codex 的 1M 上下文能力,用户只要在 `config.toml` 里加三行配置,就能解锁 GPT-5.6 Sol 的百万上下文。表面上看,这是一个“开关”,实际上它把模型的工作边界往前推了一大截。90 万 token 左右开始自动压缩历史,意味着系统要学会在长对话、长代码库和长文档里保留重点,同时牺牲一部分窗口内的原始细节。

更重要的是,官方已经提醒,512K 到 1M 之间的性能会从 91.5% 降到 73.8%。这说明百万上下文不是白送的增益,而是一笔必须认真计算的账。对需要长项目、复杂仓库和多轮修订的团队来说,它有机会减少反复喂资料的成本;但对简单任务来说,盲目拉长上下文只会把 token 消耗和延迟一起抬高。

记忆不是聊天记录

很多人会把长上下文理解成“更会记得住”,但这其实只说对了一半。聊天记录只是原材料,真正有价值的是模型能不能把前文中的规则、目标、失败历史和临时决策持续带进后续步骤。一个工具如果每一步都要重新解释一遍,它看上去很聪明,实际却很累人。

这也是为什么长上下文会改变使用习惯。开发者可以把仓库说明、接口约定、测试结果和历史报错持续放在同一个工作区里,减少来回搬运信息的次数;企业用户则能把项目背景、审批约束和合规边界长期保留,让模型更像一个持续在场的协作者,而不是每次都从零开始的临时顾问。

执行比回答难

阿里 Accio Work 发布的 RealReplicaBench 很能说明问题。107 个真实商业任务里,13 款模型全部没有跨过 60 分,Claude Opus 5 以 56.1 分居首。这个分数不只是一次测评结果,更像一记提醒:模型会回答,不等于模型会完成。真实工作不是单轮作文,而是登录、检索、比对、判断、操作、回填、复核,一步卡住,整件事就会断。

所以,AI 产业现在真正的分界线已经不在“会不会说”,而在“能不能办”。你可以让模型帮你归纳一份资料,但如果它不能把资料里的约束一直带到后续动作里,最后还是要人亲手收尾。长上下文解决的是连续性,执行系统解决的是交付性,两者缺一块都不够。

基础设施跟进

OpenAI 失去 Scott Gray 这件事也值得一起看。他不是普通研究员,而是被称为 CUDA 内核之神的人,长期参与高性能 GPU 内核、注意力计算和底层加速工作。这样的人离开,说明 AI 竞争早就不只是模型参数的比赛,而是算力利用率、内核优化、工程纪律和人才密度的比赛。模型越大,底层越不能松。

北大、阶跃星辰和北邮联合提出的 TensorCast 也在同一方向上给出了工程答案。它把张量生命周期统一管理,围绕 Identify、Place、Move、Transform、Materialize 这些原语做抽象,实验里高并发多轮 Agent 的 TTFT 最多降低 93.2%,模型启动速度最高提升 228.6 倍。这个数字的意义很直接:当任务变长、Agent 变多、状态变复杂时,谁能更快把上下文装进系统,谁就更能把长上下文变成可用能力。

研究也在变味

Fable 5 在全球 18 个自主科研任务里跑出接近人类纪录的成绩,说明 AI 已经不满足于“答题”。它开始尝试在固定目标下做连续搜索、调整策略、对齐实验结果,甚至自己改进自己的试验路径。这个方向和百万上下文的关系很近:上下文越长,模型越有机会保存中间判断,形成更接近研究流程的连续工作。

但研究型 Agent 和真正的科研工作之间,还是隔着很长一段路。模型可以在某个 benchmark 上通过多步试错拿到不错结果,却未必能在真实项目里承担责任、评估风险、解释选择。换句话说,长上下文让模型更像研究员的助手,离研究员本人还差一个“可被追责的判断链”。

企业要看的不是炫技

企业真正该看的,不是百万上下文本身有多酷,而是它能不能减少重复劳动、减少人为遗漏、减少多轮交接里的信息损耗。一个好的长上下文系统,应该让项目说明、需求变更、历史测试、业务约束都留在同一个可检索的工作环境里,让模型在执行中持续校准,而不是每次都重新开始。

这也是为什么现在越来越多 AI 产品都在往“任务完成”靠。20% 的美国打工人已经把至少一项任务外包给 AI,说明市场早就不再只把它当聊天玩具。真正决定留存的,不是它回答得像不像人,而是它能不能少出错、少打断、少返工。对用户来说,模型最好像一个靠谱的同事:记得前情,知道边界,能把活往下推进。

下一阶段

百万上下文只是开始,真正难的是把记忆、执行、权限和成本连起来。上下文放大后,推理成本会更敏感,延迟会更敏感,安全边界也会更敏感。模型一旦能读进更多资料,就必须更严格地回答“哪些能做、哪些不能做、哪些要确认后再做”。

所以这轮变化的重点,不是大模型又赢了一次,而是 AI 正在从“会说话的模型”变成“会延续状态的系统”。Codex 的百万上下文、TensorCast 的张量管理、RealReplicaBench 的真实任务测评、CUDA 内核人才的流动,拼在一起看,行业已经很清楚地走向同一个方向:未来的竞争,不只是看谁更会答题,而是看谁更能把长任务稳稳做完。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容