Gemma 4共2篇
谷歌把 Gemma 4 推快 3 倍后,本地大模型开始拼执行效率-速维云

谷歌把 Gemma 4 推快 3 倍后,本地大模型开始拼执行效率

Gemma 4 通过 Multi-Token Prediction 将推理速度最高提到 3 倍,SubQ 也把超长上下文和低成本一起往前推,AI 产品竞争正在从会说转向会做。
svyun的头像-速维云svyun1个月前
0338
Gemma 4推测解码提速三倍:AI推理竞争开始转向工程效率-速维云

Gemma 4推测解码提速三倍:AI推理竞争开始转向工程效率

谷歌为Gemma 4开放Multi-Token Prediction推测解码,在不改变模型和输出质量的情况下最高提速三倍。推理优化正在重新计算本地部署、企业应用与AI基础设施的成本。
svyun的头像-速维云svyun14天前
0436