港科大团队披露的 MoE 路由漏洞 RepetitionCurse,把大模型热闹发布背后一个更硬的问题摆上了桌面:当输入里出现大量重复 token 时,原本应该被均衡分配到不同专家和 GPU 上的计算负载,可能突然挤向少数设备,GPU 负载从接近三等分变成 98%/1%/1% 这样的极端失衡,首 token 延迟最高增加 148%,P99 SLA 违约率也会明显上升。对普通用户来说,这听起来像一篇技术论文;对真正运营大模型服务的人来说,这就是线上稳定性、成本和用户体验同时被击穿的信号。
这条新闻之所以值得放在前面,是因为 AI 竞争正在从“谁的模型更强”转向“谁的系统更扛造”。同一批重点资讯里,沐曦把 GPU 展台核心位置留给十个开源社区,中数睿智把因果世界模型投进央国企生产现场,Kimi K3继续把长上下文和开源大模型推向应用层,WAIC上的机器人和桌面超算也都在回答同一个问题:模型能力只是入口,能不能稳定部署、持续调度、被审计、被业务接住,才是下一阶段的胜负手。
MoE路由的脆弱点
MoE模型的吸引力在于“不是每次都激活全部参数”。它通过路由器把不同 token 分配给不同专家,让模型在保持大规模参数容量的同时降低单次推理成本。理论上,这是一种兼顾能力和效率的架构:专家足够多,路由足够聪明,GPU负载就能更均衡,推理系统也能以更低成本承载更多请求。
RepetitionCurse暴露的问题在于,路由并不总是像想象中那样稳。港科大发现,重复 token 输入会干扰路由分配,让本应均衡的专家选择变得拥挤。一旦某几个专家被集中调用,对应 GPU 就会排队,其他 GPU 却在空转。最终用户看到的不是“路由失衡”,而是响应变慢、等待时间拉长、服务抖动,甚至在高并发场景下触发更多超时。
稳定性变成产品能力
过去模型厂商喜欢拿榜单、上下文长度、参数规模和单题成绩讲故事,这些指标当然重要,但它们只代表模型在相对理想条件下能达到什么水平。企业真正接入AI服务时,更在意的是另一组指标:高峰时能不能稳住,异常输入会不会拖垮队列,复杂任务会不会突然成本飙升,系统是否能在出错时快速定位责任链路。

MoE路由漏洞提醒行业,AI基础设施不只是堆GPU和扩模型。它需要输入侧清洗、路由监控、专家负载告警、请求隔离、限流策略、缓存设计和回退机制。对云服务商和AI平台来说,未来卖的不只是“某个模型API”,而是一整套可观察、可调度、可恢复的推理系统。用户付费买的是结果,平台必须把底层不确定性藏在稳定体验之后。
国产算力走向生态竞争
沐曦在WAIC发布曦景S600超节点、曦索X300科学智能GPU,同时把展台的重要位置留给龙蜥、vLLM等十个开源社区,这个姿态很有信号意义。国产AI芯片如果只比单卡参数,很容易陷入和国际头部GPU的硬碰硬;但如果能围绕开源软件栈、模型适配、推理框架、开发者工具和实际部署形成生态,竞争维度就会发生变化。
其开源软件栈MXMACA已适配大量开源软件,并强调多数项目无需改代码即可运行。对企业客户来说,“能不能少改代码迁移”往往比“纸面峰值算力高多少”更现实。特别是在大模型推理进入成本精算阶段后,谁能把硬件、框架、算子、调度、运维和开发者体验串起来,谁就更有机会成为可持续使用的算力底座。
AI落地需要因果和闭环
中数睿智发布的因果世界模型,把AI落地从互联网产品拉回到能源、制造等高价值行业。它已经在多家央国企投产,覆盖大量场景,应用在生产调度、安全管控和复杂决策里,并给出安全运行、提前预警和根因定位等结果。这里的关键词不是“会聊天”,而是“能解释、能预警、能辅助决策”。
这和MoE路由问题其实是一体两面。前者说明模型服务本身需要稳定和可审计,后者说明业务现场也需要可解释和可追踪。AI如果进入生产系统,就不能只给一个看起来合理的答案;它必须说明依据、暴露不确定性、支持复核,并在错误发生时能回到链路里查原因。工业场景不会为炫技买单,只会为降低风险、提升效率和形成闭环付费。
长上下文和开源模型继续推高门槛
Kimi K3的出现,把开源模型、长上下文和智能体能力继续往前推。2.8万亿参数、百万token上下文、原生视觉理解、面向长程编程和知识工作,这些关键词意味着大模型正在进入更复杂的任务空间。更长的上下文让模型能读更多资料、接住更长项目,也会带来更复杂的推理调度、缓存管理和成本控制问题。
这正是基础设施压力上升的原因。模型越大、上下文越长、任务越复杂,系统层就越不能粗放。MoE路由、KV Cache、推测解码、负载均衡、工具调用、文件检索和权限边界都会成为产品体验的一部分。用户不会关心后台用了多少专家、多少卡、多少缓存策略,但他们会直接感受到任务是否完成、结果是否可靠、价格是否可接受。
机器人和Agent都在争夺真实流程
WAIC上的机器人企业、世界模型公司和AI眼镜厂商,呈现的是另一个方向:AI正在从屏幕里的回答,进入设备、身体和日常流程。京东开源JoyAI系列模型和EgoLive数据集,极佳视界展示“世界生成+世界行动”体系,李未可科技用记忆眼镜尝试记录、理解、执行闭环,这些都在把AI从单次交互推向持续感知和长期任务。
但越靠近真实世界,对稳定性的要求越高。一个聊天机器人偶尔答慢一点,用户还能刷新;一个仓储机器人、生产调度系统、会议记录眼镜或企业Agent一旦误判,影响就可能落到工单、设备、订单、人员和安全上。AI应用越深入,越需要底层基础设施、模型治理和业务流程一起升级。
下一阶段拼系统耐力
AI行业仍然会继续出现大模型发布、融资故事、开源项目和产品新入口,但真正拉开差距的,可能是系统耐力。RepetitionCurse这样的研究价值,在于它提醒行业不要只看平均性能,而要看极端输入、长尾请求和高峰并发下的表现。模型越像基础设施,就越要接受基础设施级别的压力测试。
从MoE路由漏洞到GPU开源生态,从因果世界模型到长上下文大模型,再到机器人和Agent进入真实流程,本次重点资讯共同指向一个结论:AI竞争正在进入工程深水区。能写出漂亮Demo的团队很多,能把模型、算力、调度、安全、业务和反馈闭环长期跑稳的团队,才会在下一阶段留下来。






