无问芯穹把 Agentic Infra 战略摆出来之后,AI 基础设施竞争里最值得盯的变量不再只是“有多少卡”,而是这些算力能不能被更细、更快、更便宜地转化为可用 Token。它披露的重点很直接:聚合超过 37000P 异构算力,推理成本年降 10 倍,日均 Token 调用量较年初增长 40 倍,并把能力延伸到具身智能场景。对行业来说,这不是一次普通的算力平台发布,而是把大模型商业化最硬的账本摊开了。

同一批重点资讯里,AI Token 经济的利润分配、Databricks 扩充 GPU 容量、SanDisk 与 SK 海力士推进 HBF 高带宽闪存、RISC-V 算力超节点,以及谷歌关于 Agent 工程的白皮书,都在回答同一个问题:当模型调用从演示级走向生产级,企业真正要买的是一套能持续交付低成本推理的系统,而不是单点模型能力。AI 行业正在从“谁的模型更强”进入“谁能把模型跑得更稳、更便宜、更接近业务动作”的阶段。
Token 成本
Token 调用量暴涨之后,推理成本会变成每一家 AI 公司绕不开的经营指标。聊天产品、代码助手、办公 Agent、视频生成、企业知识库和机器人控制都在消耗 Token,但用户愿意付的钱并不会按同样速度上涨。如果每一次调用背后都依赖昂贵显卡、冗余调度和低利用率集群,规模越大,亏损可能越明显。
无问芯穹强调推理成本年降 10 倍,说明基础设施厂商已经不满足于提供“可用算力”,而是在争夺“可结算的低价智能”。这里的关键不是单次压价,而是让异构算力、模型路由、推理加速、缓存复用和任务编排组成一条流水线。企业客户不会长期为炫技买单,它们更关心每处理一份文档、每完成一次客服对话、每生成一段代码、每控制一次设备动作,最终成本能不能算清楚。
异构调度
超过 37000P 的异构算力如果只是堆在一起,并不会自动变成效率。不同 GPU、国产 AI 芯片、CPU、存储和网络资源的性能曲线并不相同,适合跑的模型类型、批处理规模、上下文长度和延迟目标也不同。真正困难的是把任务拆开,判断哪些请求适合低成本模型,哪些请求必须走高性能模型,哪些可以延迟合批,哪些必须即时响应。
这也是 Agentic Infra 这个说法值得注意的地方。未来的基础设施不会只是被动接收请求,而会越来越像一层智能调度系统:理解任务意图、估算成本、选择模型、安排算力、回收缓存,并在失败时自动切换路径。Agent 越多,调用链越长,越需要这种调度层。否则一个复杂任务可能在多个模型、多个工具和多个数据源之间反复跳转,用户只看到等待变长,企业却要承担看不见的 Token 浪费。
利润重排
AI Token 经济看起来增长很快,但利润并不会平均流向每一层。上游芯片、内存和高端存储厂商仍然拿走了很大一部分价值,因为它们离物理瓶颈最近。模型公司和应用公司如果只做调用转售,可能面对一个尴尬局面:用户增长越快,账单越厚,毛利却被硬件和云资源吃掉。
这解释了为什么行业开始同时关注 Databricks 的 GPU 扩容、HBF 高带宽闪存、RISC-V 超节点和国产算力集群。它们表面上分属云平台、存储、芯片和系统架构,实质上都在争夺同一个位置:降低大模型推理的单位成本,并在利润重新分配时获得更高话语权。谁能把昂贵硬件变成更高利用率的稳定服务,谁就更接近 AI 商业化的中枢。
Agent 工程
谷歌白皮书把 Agent 生产力拆成 Context、Skills 与 Harness,核心意思是模型本身只是一部分,真正决定可用性的往往是外层工程。这个判断和基础设施主线是连在一起的。企业要的不是一个会回答问题的模型,而是能读取上下文、调用工具、遵守权限、追踪状态、完成交付并接受审计的工作系统。
当 Agent 进入真实业务,它对基础设施提出的要求比聊天机器人高得多。一次任务可能包含检索、规划、代码生成、表格处理、图片理解、系统操作和结果校验,每一步都可能触发不同模型调用。没有 Harness 约束,任务容易跑偏;没有 Skills 标准化,工具调用难以复用;没有 Context 管理,长任务就会遗忘。基础设施要支撑的不只是推理速度,还包括任务链路的可靠性。
具身延伸
无问芯穹把 Agentic Infra 拓展到具身智能领域,说明 Token 基础设施和物理世界正在靠近。机器人、自动驾驶、工业质检和智能设备并不只需要“会说话”的模型,它们需要在传感器数据、动作规划、仿真训练和实时控制之间形成闭环。这里的成本不只是 Token 价格,还包括延迟、稳定性和错误动作的代价。
具身智能会放大基础设施短板。云端模型再强,如果网络延迟过高、边缘侧算力不足、模型切换不稳定,机器人就无法在真实环境里可靠执行。相反,如果基础设施能够按任务把云端大模型、边缘推理、小模型控制和仿真环境组合起来,具身智能才可能从展台演示进入工厂、仓储、零售和服务场景。这也是算力平台开始关注物理 AI 的原因。
应用落点
快手电商上线 AI 购物助手、TeleAgent 主打普通职场人可用的办公智能体、腾讯 Marvis 争夺设备级入口,这些应用消息看似分散,其实都在消耗同一套底层能力。购物助手需要理解搜索意图并直接加购,办公智能体需要处理文件和流程,设备级 Agent 需要调用本地环境。它们能否规模化,不只看产品入口,也看背后基础设施能否承受高频、低价、低延迟调用。
这会让 AI 应用竞争变得更现实。过去很多产品可以靠模型新鲜感吸引用户,现在用户会追问:响应快不快,结果稳不稳,能不能直接完成动作,价格是不是合理,隐私和权限有没有边界。基础设施如果不能把这些问题压到可接受范围,应用层再热闹也很难留住真实付费。
行业信号
这组资讯释放出的信号很清楚:AI 行业的主战场正在从模型发布会转向成本曲线、工程系统和交付能力。大模型仍然重要,但单个模型的领先窗口会越来越短,真正能形成壁垒的是把模型、算力、存储、网络、调度、工具和业务流程连成稳定系统的能力。
对企业用户来说,接下来选择 AI 服务不能只看榜单分数,而要看它是否能解释成本、支持私有数据、接入现有流程、控制权限风险,并在业务高峰时保持稳定。对基础设施厂商来说,机会也不只是卖算力,而是成为 Token 流水线的组织者。谁能让 AI 调用从昂贵试验变成可核算生产力,谁就更可能站在下一阶段的核心位置。







暂无评论内容