LLaDA 2.2开源后,Agent模型开始从连续生成走向持续修正

扩散语言模型开始接管长任务

蚂蚁集团开源 LLaDA 2.2,真正值得关注的不是“又一个新模型”,而是扩散语言模型第一次被推到 Agent 长程任务的舞台中央。过去,主流大语言模型基本沿着自回归路线前进:一个 token 接一个 token 往后写,强在连续生成和对话体验,但一旦任务变长,前面某一步判断出错,后面就容易顺着错误路径继续展开。LLaDA 2.2 选择了另一条路,它把语言生成看成反复编辑和修正的过程,支持 KEEP、SUBSTITUTE、DELETE、INSERT 四类原子操作,让模型在执行任务时不只是“往下写”,还可以回头改、局部替换、删掉错误步骤,再把新内容插回任务链路。

开发者工作站上的Agentic扩散模型与AI芯片
LLaDA 2.2 代表的 Agentic 扩散路线,把长任务从连续生成推进到持续修正。

这个变化对 Agent 产品很关键。Agent 最怕的不是不会写一句答案,而是在搜索、规划、调用工具、验证结果、继续推进的过程中出现早期误判。一个真正可用的 Agent,需要像人一样不断检查中间结果,而不是把第一版计划当圣旨执行到底。LLaDA 2.2 在多项 Agent 基准上拿到 53.83 的均分,吞吐量达到自回归模型的 1.64 倍,并支持 128K 上下文,说明扩散式语言建模不再只是论文里的替代路线,而是开始正面回答长任务效率、可修正性和上下文承载能力这些工程问题。

自我修正比跑分更接近真实生产

很多企业试用 Agent 后会遇到同一个尴尬:演示时很惊艳,真正接入业务流程后却经常卡在细节里。它可能会把任务拆错、搜索到过期材料、误解用户意图,或者在写代码、做表格、整理报告时把小错误滚成大偏差。自回归模型并非不能纠错,但纠错往往依赖外部提示、额外反思步骤或另一个验证器;扩散语言模型如果能把“编辑旧答案”变成内生能力,就有机会把纠错动作做得更自然。

LLaDA 2.2 的四类原子编辑操作,听起来像文本处理里的基础动作,放到 Agent 系统里却很像一套任务维护机制。KEEP 对应保留已确认正确的信息,SUBSTITUTE 对应替换错误判断,DELETE 对应清理无效分支,INSERT 对应补充缺失步骤。长程任务并不是线性作文,而是一张会不断变化的工作草稿。模型能够在草稿上反复改写,意味着它更适合处理研究检索、代码修复、复杂报告生成、数据分析和多工具协作这类需要中途校验的任务。对使用者来说,这比单次回答更漂亮更重要,因为真实生产要的是少返工、少跑偏、能收口。

Agent基础设施正在补齐

同一批重点资讯里,SearchOS 的出现也说明 Agent 竞争正在从“模型聪不聪明”转向“系统能不能稳”。人大和蚂蚁开源的 SearchOS 给搜索智能体补上上下文管理、流水线调度、工具中间层和搜索技能库,瞄准的是长程检索任务里的状态丢失、重复查询和信息遗漏。它和 LLaDA 2.2 放在一起看很有意思:一个从模型生成机制上强化自我编辑,另一个从系统框架上强化协作调度,二者共同指向 Agent 产品最缺的一块——持续、可靠、可复盘地完成复杂任务。

开发者工具方向也出现了相似信号。围绕 Agent 搜索、Skill 定制、目标定义和代码协作的讨论越来越多,说明行业已经意识到,只靠更大的模型并不能自动带来更好的工作结果。用户真正需要的是一套从目标澄清、资料检索、任务拆解、执行验证到结果交付的闭环。扩散模型的自我修正能力,如果能和 SearchOS 这类系统层框架结合,未来的 Agent 可能不再只是“会调用工具的聊天机器人”,而更像一个带有任务记忆、流程管理和质量门禁的工作系统。

模型成本和开源生态继续施压

模型路线变化背后,还有一个更现实的变量:成本。Polsia 的案例很直接,这家几乎没有全职员工的 AI 初创公司,曾经每月烧掉约 120 万美元 AI 账单,后来使用中国开源模型把月度成本降到约 10 万美元,降幅超过九成。这个故事不只是“开源模型便宜”,而是提醒所有 AI 应用公司:如果推理成本不可控,再好的产品想象都会被账单拖垮。Agent 任务越长、工具调用越多、上下文越大,成本压力越明显。

Kimi K3、Boogu-Image-0.1、LLaDA 2.2 等开放模型连续出现,把开源生态的竞争推向了更高参数规模、更长上下文、更低训练成本和更细分能力。应用公司会越来越少只问“哪个模型最强”,而是改问“哪个模型在我的场景里足够强、足够便宜、足够可控”。这也是 LLaDA 2.2 的潜在价值:如果扩散式生成能在长程任务里保持更高吞吐和更强修正能力,它对企业 Agent 的吸引力就不只是技术新鲜感,而是可能落到单位任务成本、失败率和交付稳定性上。

世界模型把AI拉向真实环境

除了语言模型,世界模型和具身智能也在快速补短板。智在无界发布 Being-H0.8,把触觉融入“预测—执行—反馈”链路,让模型在精细操作中能进行接触预判和实时调整;北大、清华、北航、上交、中科大联合发布 TriWorldBench Challenge,用三视角同步任务评估机器人世界模型;LeCun 团队的 VISReg 则试图解决 JEPA 世界模型中的表征坍塌问题。这些进展共同说明,AI 正在从会说、会写、会搜,走向对环境、动作和反馈的更深理解。

这和 Agentic 扩散模型并不割裂。语言 Agent 需要在信息世界里不断修正任务草稿,机器人和世界模型则需要在物理世界里不断修正动作计划。前者面对的是搜索结果、代码仓库、业务文档和工具返回值;后者面对的是物体接触、空间关系、动作偏差和环境变化。两条线最后都会汇合到同一个问题:AI 能不能在不确定环境中持续行动,并根据反馈调整自己。只有补上这个能力,Agent 才能从“看起来聪明”变成“真的能接活”。

应用落地开始进入筛选期

应用层也在给模型能力施加压力。支付宝推出“颜选好物”AI购物服务,试图让 AI 进入消费决策上游;智诊科技的 WiseDiag V3 和好伴 AI 把医疗 AI 从单次问答推进到持续服务;Kando AI 拿到种子轮融资,定位“决策领域的 Cursor”,强调记忆、后训练和反馈闭环;Spectro Cloud 则从 GPU 管理切入,把企业算力利用率和本地推理成本作为卖点。这些案例分布在购物、医疗、决策、基础设施等不同场景,但共同点是都不再满足于做一个会聊天的入口。

接下来,AI 产品会进入更残酷的筛选期。用户会关心它能不能减少真实工作量,企业会关心它能不能降低成本、提高转化或压缩交付周期,开发者会关心它能不能被稳定集成进现有系统。LLaDA 2.2 代表的 Agentic 扩散路线,SearchOS 代表的系统框架,Polsia 案例代表的成本约束,以及世界模型方向代表的环境理解,拼起来就是 AI 行业的新门槛:模型要能修正,系统要能调度,成本要能承受,场景要能闭环。谁能把这四件事同时做好,谁才有机会把 Agent 从热门概念变成真正可持续的生产力。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享