扩散语言模型让Agent提速五倍:端侧AI开始争夺并行执行能力

AI智能体越来越像一个真正的执行系统,但它的速度瓶颈,可能并不在模型“想得够不够多”,而在于仍然沿用逐字生成的老办法。DiffuSpace与Acrab的联合测试给出了一个颇有冲击力的结果:在端侧场景中,扩散语言模型能够把Agent的运行速度提升约五倍。双方计划进一步推动这项技术进入AI PC、智能汽车、机器人和智能家居。

Stunning cityscape featuring skyscrapers and city lights at twilight with a clear blue sky.

这个变化值得关注,并不是因为“五倍”本身足以替代所有模型,而是因为它把大模型竞争从参数规模和单次回答,推向了并行执行、设备响应和持续工作。Meta推出可处理超一小时音频、支持二十多人同时对话的Muse Voice Transcribe,鼎犀智创则把材料研发周期从数千天压缩到几天,几个方向共同说明:AI正在争夺的不是聊天窗口,而是现实任务中每一秒的有效产出。

逐字生成的瓶颈

主流自回归模型通常按照顺序生成Token,前一个位置确定之后,后一个位置才能继续。这种方式便于控制生成过程,也已经形成成熟的训练和推理体系,但对Agent来说,等待会被放大。一个智能体要先理解目标,再规划步骤、调用工具、读取返回结果,最后生成下一轮动作;如果每次输出都要逐个等待,网页操作、设备控制和多轮工具调用就会积累明显延迟。

扩散语言模型的思路不同。它不必把所有内容严格排成一条线,而是通过多轮去噪和全局修正,同时预测多个位置,再逐步把结果稳定下来。对于需要快速形成指令、短文本、代码片段或动作序列的任务,这种并行性可以更充分地利用端侧芯片的计算能力。它并非在所有长文本和复杂推理中都天然占优,但在“尽快完成一组可执行输出”的场景里,方向非常有吸引力。

五倍提速意味着什么

如果Agent在电脑上处理一个简单任务只需要几秒,速度提升可能只是体验更顺滑;但当它要连续执行几十步,差距就会变成生产效率。智能汽车需要在极短时间内完成感知、决策与控制之间的信息交接,机器人需要及时响应视觉和传感器输入,家庭设备则不能让用户为了一个简单指令等待过久。端侧推理减少了网络往返,并行生成又压缩了计算等待,两者结合后,设备才更接近“随叫随到”的助手。

更重要的是,速度会改变Agent的工作方式。较慢的系统倾向于把多个动作合并成一次复杂请求,以减少交互次数;更快的系统则可以频繁观察环境、执行小步骤、检查结果,再决定下一步怎么走。这种“行动—反馈—修正”的节奏,尤其适合不确定性较高的真实环境。它也提醒企业,评估Agent不能只看最终成功率,还要记录单步延迟、失败恢复时间、设备功耗和长任务中的有效动作比例。

端侧芯片迎来新考题

扩散语言模型要真正落地,不能只在论文或云端服务器上证明速度优势。端侧设备受制于内存容量、散热、电池和模型大小,推理框架还必须适配不同厂商的NPU、GPU或专用加速器。全局生成带来的并行计算,需要编译器、算子库和内存调度共同配合,否则理论上的吞吐提升可能被数据搬运和调度开销抵消。

因此,芯片厂商接下来比拼的不会只是峰值算力,而是能否为扩散式生成提供稳定的并行执行单元,能否在低功耗下保持持续响应,以及能否让模型开发者以较低成本完成部署。AI PC、车载计算平台和机器人控制器的竞争,也会因此从“能不能运行大模型”转向“能不能长时间、高频率地运行任务”。这对国产端侧芯片和软件生态都是一次新的压力测试。

语音入口正在变宽

Meta推出Muse Voice Transcribe实时音频感知模型,支持七十多种语言,能够处理中英文夹杂的语音,覆盖超过一小时的长音频和二十多人同时对话的场景,API价格为每一千分钟三美元。它的价值不只是把录音转成文字,更在于让Agent获得连续、多人和多语种的现场上下文。会议纪要、客服质检、车内对话和家庭照护,都需要系统从嘈杂环境中判断谁说了什么、什么时候说的。

语音理解和端侧快速生成结合起来,才可能形成自然的实时助手。前端负责持续听取环境,模型快速提炼重点,Agent再根据权限调用日程、文档或设备控制工具。如果识别结果每隔几秒才更新一次,后面的自动化就会显得笨拙;如果模型反应足够快,又能在不确定时请求确认,语音交互便会从“问一句答一句”变成连续协作。未来的竞争焦点,是速度、准确率和隐私保护能否同时成立。

从算得快到做得成

鼎犀智创完成数亿元Pre-A轮融资,其RhinoMat大模型与自动化实验系统结合后,将烯碳和芳纶复合纤维的研发周期从约两千天压缩至四天,电解液配方研发从一百八十天缩短到三十天,实验量减少百分之七十五。材料科学与语言模型看似距离很远,但它们面对的是同一个问题:如何把模型的计算能力嵌入连续流程,并让每轮输出都能被下一轮实验或动作验证。

这也是端侧Agent提速之后必须回答的问题。更快的模型如果只是更快地产生未经检查的建议,价值有限;只有当它能够读取传感器、调用工具、保留状态并根据结果修正方案,速度才会转化为交付能力。无论是材料实验、工业质检还是企业办公,系统都要把输入、决策、执行和验收串成证据链,而不是用一张漂亮的演示截图代替真实结果。

部署时先算清成本

对中小企业来说,端侧部署的吸引力在于减少云端调用、降低延迟,并把敏感数据留在设备或内网中。但这并不等于买一块芯片就能完成升级。团队仍需评估模型更新频率、设备数量、故障维护、数据同步和权限管理。对于需要弹性算力的任务,可以使用速维云等云端资源承载训练、批量处理和统一监控,再把适合实时响应的小模型下沉到本地,形成云边协同的架构。

真正稳妥的路线,是先选一个边界清晰的任务做试点:例如会议转写、设备巡检、代码补全或工单分拣。上线前记录基线延迟、错误率和人工处理成本,上线后再比较Agent是否减少了等待和重复劳动。涉及付款、生产控制、账号权限或重要数据时,必须保留人工确认、操作审计和失败回滚。速度提升不能成为放宽权限的理由,恰恰应该让系统有更多时间进行检查。

AI执行层的新竞争

扩散语言模型把并行生成带到Agent执行,Muse把连续语音带进上下文,RhinoMat则展示了模型与自动化实验结合后的效率提升。它们共同指向一个判断:AI产品的下一阶段,不是把回答写得更长,而是让系统更快理解环境、更稳调用工具,并把结果交给可以验证的流程。模型只是其中一层,芯片、操作系统、数据接口和业务规则同样决定最终体验。

未来用户感知到的AI,可能并不会以“我使用了哪个模型”的方式出现。它会藏在电脑、汽车、机器人、实验室和企业系统里,在需要时迅速完成一小段工作,再把关键结果交给人确认。谁能把并行推理、低功耗运行、可靠记忆和安全治理组合起来,谁就更有机会成为真正的执行入口。AI竞争已经从生成速度,走向了可持续、可复核、可承担责任的工作速度。

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享