AI基础设施 第4页
MoE路由被重复Token打崩后,AI基础设施开始补安全和部署短板-速维云

MoE路由被重复Token打崩后,AI基础设施开始补安全和部署短板

港科大RepetitionCurse揭示MoE路由在重复Token输入下可能导致GPU负载严重失衡,沐曦GPU开源生态、因果世界模型和Kimi K3等动态共同说明,AI竞争正在从模型能力转向可部署、可审计、可持续运行的...
svyun的头像-速维云svyun1个月前
5414
AI服务器突然变贵,影子债务与内存涨价开始重算算力成本-速维云

AI服务器突然变贵,影子债务与内存涨价开始重算算力成本

数据中心影子债务、GPU与内存涨价、Agent额度异常共同推动AI基础设施进入成本清算,企业开始重新计算模型与算力的真实回报。
svyun的头像-速维云svyun29天前
0309
Gemma 4推测解码提速三倍:AI推理竞争开始转向工程效率-速维云

Gemma 4推测解码提速三倍:AI推理竞争开始转向工程效率

谷歌为Gemma 4开放Multi-Token Prediction推测解码,在不改变模型和输出质量的情况下最高提速三倍。推理优化正在重新计算本地部署、企业应用与AI基础设施的成本。
svyun的头像-速维云svyun前天
0416
模型开始优化自己的运行系统:国产算力迎来RSI实战-速维云

模型开始优化自己的运行系统:国产算力迎来RSI实战

智谱让模型以Infra Agent身份参与优化推理系统,在10万颗国产AI加速器集群上将KV开销从超过30%降至1%以下。RSI开始从概念走向可测试、可回滚的工程流程,模型效率、安全边界与企业部署方式正在...
svyun的头像-速维云svyun5天前
0317
韩国全民AI计划启动:免费服务、国产模型与公共算力如何连成一体-速维云

韩国全民AI计划启动:免费服务、国产模型与公共算力如何连成一体

韩国启动AI for All计划,向5100万国民提供免费无限量AI服务,并要求八成算力运行国产模型。全民AI背后,是模型、GPU、公共服务与产业生态的一体化竞争。
svyun的头像-速维云svyun16天前
05511
MiniMax M3成为阿拉伯语大模型底座:AI竞争从模型参数走向推理基础设施-速维云

MiniMax M3成为阿拉伯语大模型底座:AI竞争从模型参数走向推理基础设施

沙特HUMAIN基于MiniMax M3推出阿拉伯语大模型,英伟达推理指南、AI PC与数据系统等进展表明,AI竞争正从模型参数扩展到开源底座、推理效率和真实部署。
svyun的头像-速维云svyun19天前
5513