排序
GPU不再闲着,AI推理基础设施开始变成硬仗
vLLM 与 SGLang 商业化、RadixArk 分拆融资,把 GPU 利用率和推理调度推到 AI 竞争核心。模型越强、Agent 越长程,真正决定产品能否规模化的,正在变成算力调度、成本控制和系统稳定性。
国产GPU直通RDMA实测后,AI基础设施竞争开始重做数据通路
奇异摩尔和壁仞科技把国产GPU直通国产RDMA网卡的IBGDA方案拿出来实测时,AI算力竞争里一个长期被低估的问题被推到台前:模型能不能跑得快,不只取决于GPU本身,还取决于芯片之间、服务器之间、...
Token调用暴增之后,AI基础设施竞争开始重算推理成本
Agentic Infra、Token 调用增长、异构算力调度和 Agent 工程共同说明,AI 竞争正从模型参数转向推理成本、系统效率和可交付能力。
Gemma 4推测解码提速三倍:AI推理竞争开始转向工程效率
谷歌为Gemma 4开放Multi-Token Prediction推测解码,在不改变模型和输出质量的情况下最高提速三倍。推理优化正在重新计算本地部署、企业应用与AI基础设施的成本。







