排序
MoE路由被重复Token打崩后,AI基础设施开始补安全和部署短板
港科大RepetitionCurse揭示MoE路由在重复Token输入下可能导致GPU负载严重失衡,沐曦GPU开源生态、因果世界模型和Kimi K3等动态共同说明,AI竞争正在从模型能力转向可部署、可审计、可持续运行的...
Gemma 4推测解码提速三倍:AI推理竞争开始转向工程效率
谷歌为Gemma 4开放Multi-Token Prediction推测解码,在不改变模型和输出质量的情况下最高提速三倍。推理优化正在重新计算本地部署、企业应用与AI基础设施的成本。
模型开始优化自己的运行系统:国产算力迎来RSI实战
智谱让模型以Infra Agent身份参与优化推理系统,在10万颗国产AI加速器集群上将KV开销从超过30%降至1%以下。RSI开始从概念走向可测试、可回滚的工程流程,模型效率、安全边界与企业部署方式正在...
韩国全民AI计划启动:免费服务、国产模型与公共算力如何连成一体
韩国启动AI for All计划,向5100万国民提供免费无限量AI服务,并要求八成算力运行国产模型。全民AI背后,是模型、GPU、公共服务与产业生态的一体化竞争。
MiniMax M3成为阿拉伯语大模型底座:AI竞争从模型参数走向推理基础设施
沙特HUMAIN基于MiniMax M3推出阿拉伯语大模型,英伟达推理指南、AI PC与数据系统等进展表明,AI竞争正从模型参数扩展到开源底座、推理效率和真实部署。








