排序
DeepSeek DSpark提速后,大模型竞争开始转向推理效率
DeepSeek 为 V4 推出 DSpark 和 DeepSpec,推理速度提升并开源工程框架。叠加搜索 Agent、GPU 编程和实时流式 Agent 的进展,大模型竞争正在从单纯能力走向推理效率、工程系统和真实业务稳定运...
OpenAI把GPT-5.6 Sol提速14倍后,模型战开始卷推理速度和成本
OpenAI联合Cerebras把GPT-5.6 Sol推理速度提升到750 tokens/s,Google同步用Gemini 3.7 Flash降低企业Agent和Coding成本,模型竞争正在从单纯跑分转向推理速度、成本和工作流交付。
MiniMax M3成为阿拉伯语大模型底座:AI竞争从模型参数走向推理基础设施
沙特HUMAIN基于MiniMax M3推出阿拉伯语大模型,英伟达推理指南、AI PC与数据系统等进展表明,AI竞争正从模型参数扩展到开源底座、推理效率和真实部署。
Gemma 4推测解码提速三倍:AI推理竞争开始转向工程效率
谷歌为Gemma 4开放Multi-Token Prediction推测解码,在不改变模型和输出质量的情况下最高提速三倍。推理优化正在重新计算本地部署、企业应用与AI基础设施的成本。






