模型开始优化自己的运行系统:国产算力迎来RSI实战

智谱把一件过去更像科幻设想的事,放进了真实的计算集群:GLM-5.3-Flash在两周内部署到10万颗国产AI加速器组成的系统中,并以Infra Agent身份参与推理系统优化。它没有重新发明一个更大的模型,而是盯住承载模型运行的底层链路,定位KV Transfer调度重叠、精度误差等隐藏问题,最终让KV开销从超过30%降到1%以下,Decode Kernel性能提升1.71倍,端到端吞吐提升3.2倍。

这条消息的重要性,不在于又多了一个漂亮的评测数字,而在于模型第一次被放到“优化自己的工作环境”这个位置上。它仍然需要人类设定目标、提供工具和审核改动,但已经能够观察运行轨迹、提出修复方案,再用反馈判断修复是否有效。RSI,也就是递归自我改进,开始从口号变成一条可以拆解、测量和回滚的工程流程。

模型开始看懂自己的底座

大模型推理并不是把输入交给显卡后静静等待答案。长上下文会带来大量KV Cache,多个请求需要在不同设备之间传输状态,调度器要安排Prefill和Decode,算子还要面对显存、带宽、精度和并发的共同约束。任何一个环节出现重叠或空转,用户看到的就会是更高延迟和更贵的Token。

过去,这些问题通常由系统工程师通过日志、Profiling工具和大量实验逐项排查。GLM-5.3-Flash的尝试,是让模型以Infra Agent身份参与这个过程:先理解性能指标和调用轨迹,再定位可能的瓶颈,提出调度或内核层面的修改,最后根据新的吞吐、延迟和精度结果判断方案是否成立。它优化的不是回答内容,而是回答能够被生产出来的那套机器。

RSI不是模型自己升级参数

“AI自己改进自己”很容易被理解成模型无需人类就能修改参数、重新训练,甚至持续突破所有限制。但这次案例更接近受控的工程闭环:人类提供目标和边界,模型利用工具读取证据,围绕一个可验证问题生成候选方案,再把结果交给测试系统确认。只要没有通过性能、精度和稳定性检查,改动就不能进入生产环境。

这种边界反而更有价值。它把RSI从宏大的终局叙事,拆成了几个可以审计的层次:能否发现异常,能否解释原因,能否生成有效修复,能否在新负载下保持收益,能否在失败时恢复原状。端到端吞吐提升3.2倍当然值得关注,但更关键的是这套方法能不能在换模型、换芯片、换业务流量之后继续工作,而不是只对一次实验配置有效。

AI加速器与主板电路,象征模型参与优化自身运行系统
模型能力的下一步竞争,正在延伸到承载推理的芯片、内存和调度系统。图片来源:Pexels

国产算力迎来真实压力测试

10万颗国产AI加速器的意义,也不只是规模足够大。不同芯片在内存层级、通信方式、算子支持和精度表现上都有差异,模型迁移到这样的集群后,原本在单卡或小规模环境里不明显的问题可能被放大。KV传输重叠和精度误差如果长期存在,集群越大,浪费的计算资源就越多。

因此,RSI在国产算力上的一次有效落地,实际上同时检验了模型、编译器、通信库和运维系统。模型能够发现底层不协调的位置,相当于给算力基础设施增加了一名持续工作的诊断工程师。对企业而言,这比简单宣称“支持国产卡”更有参考价值:真正的适配要看高并发下的有效吞吐、故障恢复时间、模型精度损失和每个任务的综合成本。

小模型也能占据执行层

同一批资讯里,前OpenAI研究员Diogo Almeida发布Jev模型,放弃文本生成,专注分类、打分和路由等结构化判断任务。该模型响应时间约70到500毫秒,速度提升20到200倍,成本降至同类方案的四百分之一,输入价格每百万Token为0.042美元,输出免费。它的方向与RSI形成了另一种呼应:AI系统不一定需要让每个环节都调用最大的语言模型。

在一个复杂Agent工作流中,通用模型可以负责拆解目标,Jev这类专用模型负责判断请求类型、选择工具、筛掉低质量结果,再由执行模块完成动作。这样做既减少等待,也降低上下文传输和重复推理的消耗。未来的系统效率,很可能来自模型之间的分工,而不是让一个旗舰模型包办所有判断。谁能把不同大小、不同成本的模型编排起来,谁就能把RSI带来的收益保留下来。

自我改进必须先学会自我约束

模型参与系统优化后,风险也从“回答错了”变成“把生产系统改坏了”。上海AI Lab联合复旦、上海交大等机构提出SHE与SafeEvolve,尝试让Agent安全从静态Prompt防护转为基于执行轨迹持续演化。实验中,SHE把Harness拆成不同组件,从实际轨迹诊断风险并更新策略,攻击成功率从17.1%降到5.5%;SafeEvolve又把安全经验写入Policy Model,在Qwen3.5-4B上将攻击成功率从2.37%降到0.79%。

这说明“让Agent自己变强”和“让Agent保持安全”不能分成两套互不相干的系统。模型每学会一种新工具,就可能获得新的越权路径;每次修复一个问题,也可能引入新的兼容性风险。可靠的进化流程需要沙箱、权限分层、回放测试、人工审批和一键回滚。尤其是涉及内核、调度、数据库或网络策略的修改,建议把自动生成和自动上线严格分开,任何高影响变更都要经过独立验证。

做梦式训练降低试错账单

谷歌发布的Dream-RSI论文,则把“先在虚拟环境里试错”带入模型自我改进。系统通过模拟环境测试探索策略,在Lasso任务中节省162倍Agent调用,在数学优化任务中节省50倍预算,内核性能最高提升2.09倍。它的价值并不是让虚拟世界替代现实,而是把大量低风险、重复性的探索先搬到成本更低的地方。

对推理系统来说,虚拟环境可以复现不同并发量、缓存命中率和故障注入条件;对业务Agent来说,可以先在脱敏数据和模拟工具里验证动作链。只有通过模拟测试的方案,才进入小流量真实环境。这样既能让模型积累更多经验,也能避免它为了追求一个局部指标,直接拿线上系统当实验场。RSI能否持续,最终取决于每次试错的价格是否可承受。

企业要算完整的收益

模型主动优化底层系统,确实可能带来吞吐提升和成本下降,但企业不能只看峰值性能。一次改动可能需要额外的评测集、监控服务和人工审核;一次失败的自动修复,可能让服务回滚数小时;为了保存长上下文和执行轨迹,存储与日志成本也会增加。真正应该计算的是单位任务成本、成功交付率、平均恢复时间和长期维护投入。

对于需要持续运行模型服务、任务队列和监控系统的团队,云服务器环境的稳定网络、资源隔离和弹性扩容同样重要。像速维云这样的基础设施平台,可以作为部署模型网关、日志系统和自动化测试环境的选项,实际选型仍要结合GPU或国产加速卡适配、磁盘吞吐、备份策略和访问控制来评估。RSI不是把所有运维工作交给模型,而是让模型参与运维,同时把每一次参与都纳入可追踪的系统管理。

下一场竞争是可验证进化

Gemini 4 Pro疑似在Code Arena中提前泄露的消息,显示模型厂商仍在扩大上下文和Coding、Agent能力;Manus计划在拆分后完成约5亿美元融资,也说明市场继续为能够自动完成任务的智能体定价。但这些产品最终都要回答同一个问题:它们能否在真实环境里稳定完成工作,而不是只在演示或榜单中表现突出。

智谱这次案例给出的方向更具体:让模型观察运行系统,用证据定位瓶颈,以受控方式生成修复,再通过独立指标确认收益。未来的AI基础设施可能会出现一层“进化控制面”,负责管理模型提出的优化建议、沙箱测试、权限审批、灰度发布和回滚记录。谁能把这条链路做得足够透明,谁就能把自我改进从宣传概念变成可交付能力。

AI开始优化承载自身运行的系统,并不意味着人类工程师马上退出现场。相反,工程师的工作会更集中在目标定义、测试设计、风险边界和异常判断上。机器负责扩大搜索,系统负责记录证据,人类负责决定什么样的改进值得上线。RSI真正成熟的标志,不是模型改得有多快,而是它每一次变强都能说明原因、承受验证,并在不该继续时及时停下来。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容