vLLM 与 SGLang 同日进入商业化阶段,把大模型竞争里一个最硬的现实问题推到了台前:不是谁能买到更多 GPU,而是谁能让已经买到的 GPU 少一点空转。RadixArk 从 SGLang 分拆出来,获得英伟达、AMD 等支持,目标直指推理服务中的利用率、延迟和吞吐瓶颈。这类消息看上去不像模型发布那样热闹,却更接近 AI 公司每天都要面对的成本账。

过去一年,模型能力、上下文长度、智能体协作和多模态生成不断刷新用户想象,但真正支撑这些体验的是一层越来越复杂的推理基础设施。用户看到的是一次回答、一次代码生成、一次游戏事件演算,平台背后看到的却是显存占用、KV 缓存、批处理调度、请求排队和峰谷负载。GPU 利用率开始成为 AI 产品能不能长期跑下去的分水岭。
GPU不该闲着
AI Infra 的核心矛盾很直接:算力贵,需求波动大,模型推理又天然容易浪费资源。一个请求进来,系统既要保证首字响应足够快,又要在多个用户、多个模型、多个任务之间尽量合并计算。只要调度策略不够细,昂贵 GPU 就会在等待、切换和碎片化显存里损耗效率。
vLLM 和 SGLang 之所以重要,是因为它们解决的不是单个模型能不能回答问题,而是大规模服务能不能把回答稳定、便宜、快速地送到用户面前。连续批处理、KV 缓存管理、推理图优化、前后端分离,这些技术细节原本藏在工程团队内部,现在已经变成资本和云厂商共同押注的基础层能力。
商业化的信号
当开源推理框架开始拆分公司、融资、绑定芯片厂商,说明市场已经确认它们不只是开发者工具,而是 AI 产业链里的关键中间层。模型公司需要它们降低服务成本,云厂商需要它们提高集群利用率,企业客户则需要它们把不同模型接进自己的业务系统,避免每一次模型升级都推翻底层架构。
这也解释了为什么英伟达、AMD 会关注这一层。芯片厂商卖的不再只是硬件规格,而是包括编译器、推理框架、调度系统和生态适配在内的完整算力交付能力。GPU 越强,如果上层软件不能把任务填满,性能就无法真正转化成收入。AI 基础设施竞争正在从“堆卡”转向“榨干每一张卡”。
模型越强越吃调度
OpenAI 全新模型 Astra 的爆料也让这个问题更清楚。相关消息称,这一系列模型面向多 AI Agent 长时间协同工作,可处理复杂项目和高阶数学问题。如果这类能力落地,推理系统承载的就不再是短问短答,而是持续数小时甚至更久的多步骤任务,期间还可能调用工具、读写文件、复盘错误并派生子任务。
长程智能体越普及,后端资源调度越不能粗放。一次任务可能包含规划、搜索、代码执行、验证、总结等多个阶段,不同阶段对延迟、上下文和并发的要求完全不同。把所有请求都当成普通聊天来处理,成本会迅速失控;按任务阶段做细粒度调度,才有可能让复杂 Agent 从演示走向日常生产。
应用正在放大账单
Pax Historia 这款由 3 人团队开发的 AI 历史策略游戏,已经能处理每周千亿级 Token 消耗。玩家用自然语言控制国家、发动战争、签订协议,AI 生成后续事件和世界反馈。这类产品的有趣之处在于,它不是偶尔调用模型,而是把模型变成游戏循环的一部分,用户越活跃,推理账单越像基础运营成本。
同样的问题也会出现在办公智能体、代码助手、客服语音 Agent、AI 视频创作和企业知识库里。AI 应用越接近真实工作流,请求就越频繁、上下文越长、结果越需要稳定。一个产品能不能赚钱,不只取决于用户愿不愿意付费,还取决于每次交互背后的推理成本有没有被压到合理区间。
现实世界还没准备好
中国科大用机器实验室测试 AI 科学能力的研究给出了另一面提醒:在 45 个工作站、4608 次测试中,只有很少比例的工作流可以自动执行。这个结果说明,真实世界系统比聊天界面复杂得多,AI 不仅要会推理,还要能理解环境状态、执行步骤、处理异常,并在失败后恢复。
这类压力测试对基础设施提出了更高要求。AI 进入实验室、企业流程或物理世界后,系统必须记录每一步动作,控制权限边界,支持回滚和人工接管。推理框架负责把算力跑满,工作流系统负责把任务跑稳,两者缺一不可。否则模型再强,也只能停留在看起来聪明的回答里。
成本变成产品能力
DeepSeek-V4-Flash 的极限测试也从另一个角度说明,便宜 Token 会改变应用形态。当一次大规模调用的成本被压低,开发者就会更愿意让模型多试几步、多验证几轮、多保留上下文。看似只是价格下降,实际会刺激更复杂的 Agent 工作流出现。以前因为成本太高不敢做的自动化,现在会重新进入产品经理和工程团队的待办清单。
但低价本身不是终点。缓存命中率、并发控制、失败重试、工具调用策略都会影响最终账单。一个模型标价低,如果应用层反复无效调用,仍然会把成本打爆;一个模型标价较高,如果框架能减少冗余 Token、压缩上下文、复用中间状态,反而可能更适合稳定业务。未来 AI 产品的竞争,会越来越像云服务竞争:单次报价重要,系统总拥有成本更重要。
基础设施进入深水区
从 GPU 利用率到长程 Agent,从 AI 游戏到机器实验室,几个关键事件共同指向一个变化:AI 行业正在从“模型能做什么”进入“系统能不能承受”的阶段。模型发布仍然重要,但推理成本、服务稳定性、调度效率和权限治理,正在决定产品能否规模化。
接下来,AI 基础设施的竞争不会只发生在数据中心,也会进入每一家正在落地 AI 的公司。谁能把模型、算力、框架和业务流程接得更紧,谁就能用更低成本提供更稳定的体验。GPU 不闲着只是第一步,真正的目标是让每一次 Token 消耗都更接近业务价值。







暂无评论内容