奇异摩尔和壁仞科技把国产GPU直通国产RDMA网卡的IBGDA方案拿出来实测时,AI算力竞争里一个长期被低估的问题被推到台前:模型能不能跑得快,不只取决于GPU本身,还取决于芯片之间、服务器之间、内存层级之间的数据能不能顺畅流动。400G RDMA ASIC引擎、小包吞吐、All-to-All通信延迟这些词听起来很工程,但它们决定的是大模型训练和推理在真实集群里到底能不能稳定扩张。
同一批重点资讯里,SanDisk和SK海力士提出高带宽闪存HBF,试图给AI推理补上大容量参数存储;Databricks融资30亿美元扩充GPU容量;Token调用量暴增却让利润集中在英伟达、美光等上游;RISC-V AI算力超节点也在强调高速互联和软件栈。这些事件拼在一起,说明AI基础设施正在从“买更多GPU”进入“重做数据通路”的阶段。谁能把网络、内存、芯片、软件栈和业务负载连成一个更高效的系统,谁才更接近下一轮算力红利。
网络瓶颈
奇异摩尔与壁仞科技展示的国产GPU直通国产RDMA网卡方案,核心不是给集群再加一块网卡,而是减少数据在CPU、内存、网卡和GPU之间来回搬运的损耗。大模型训练里的All-to-All通信、参数同步、专家模型路由、KV Cache调度,都会制造大量小包和高频通信。如果网络路径不够短、协议栈开销过高,昂贵GPU就会在等待数据时空转。
这也是为什么“国产GPU直通国产RDMA网卡”值得单独拿出来看。它对应的是AI集群从单机性能竞争走向系统效率竞争。过去很多算力宣传喜欢强调单卡峰值、显存容量和理论算力,但真实训练和推理要看集群整体利用率。小包吞吐提升、延迟下降、以太网生态可用,意味着国产算力不再只是在芯片参数上追赶,而是开始补齐互联、调度和工程部署这几块短板。
内存分层
SanDisk和SK海力士提出的HBF更像是在回答另一个问题:当模型参数越来越大,HBM再贵也不可能无限堆。HBF把NAND Flash通过3D封装堆叠引入AI推理场景,目标是单堆栈512GB容量、1.6TB/s读取带宽。它不是要直接取代HBM,而是把大体量、静态、读密集的模型参数放进新的存储层级里,让昂贵HBM承担更高频、更敏感的热数据。
这个思路很现实。推理时代的成本结构和训练时代不同,用户请求分散、上下文变长、模型形态多样,系统要频繁读取大规模权重和缓存。如果所有压力都压在HBM上,成本会被拉到很高;如果低速存储参与过多,延迟又会拖垮体验。HBF的价值在于给推理系统多一个中间层,让内存容量、带宽和成本有重新组合的空间。AI基础设施越往商业化走,这种分层设计就越重要。

利润分配
Token调用量暴增却没有让所有AI公司同时赚钱,反而把产业链利润分配的问题暴露得更清楚。资讯提到,全国日均调用量已经达到超140万亿Token,而英伟达Q1营收816亿美元、毛利率74.9%,美光毛利率也高达84.9%;与此同时,OpenAI等模型厂商仍承受巨额亏损。也就是说,需求在增长,但现金流更容易先流向离物理瓶颈最近的环节。
这并不奇怪。AI服务看上去是软件,但背后消耗的是电力、芯片、显存、网络、机房和运维。模型公司可以通过价格战扩大用户规模,却很难在短期内绕开硬件成本。上游供应紧张时,GPU、HBM、高速网络和服务器厂商拥有更强议价能力;当算力供给缓和后,利润才可能向模型服务、企业应用和行业解决方案重新分配。现在的关键变量,是谁能把每一块硬件榨出更高有效吞吐,而不是简单堆更多设备。
融资信号
Databricks的新一轮融资也放在这条线上看。它计划融资30亿美元,估值升至1880亿美元,资金用途之一就是扩充GPU容量,满足客户构建开源AI应用的需求。Databricks的年化收入超过54亿美元,AI相关年化销售额超过14亿美元,这说明企业AI需求确实在释放,但企业客户要的不只是一个模型接口,而是数据、训练、部署和治理都能跑起来的平台。
这类融资其实在提醒行业,AI基础设施正在分层。底层是芯片、内存、网络和数据中心;中间是GPU云、数据平台、模型托管和开发工具;上层才是面向业务的Agent、搜索、购物助手、办公协作和行业应用。哪一层能够把复杂性封装得更好,哪一层就能拿到更高估值。Databricks押注的是数据与AI应用之间的连接层,而国产RDMA、HBF和RISC-V超节点押注的是更底层的供给能力。
国产路径
国产算力要真正进入大规模AI场景,不能只靠“替代某一颗芯片”。RISC-V AI算力超节点强调32到128卡全互联、单柜百T级带宽,以及用软件栈和算子工具降低开发成本;国产GPU直通RDMA网卡强调网络路径和集群通信;高带宽存储则强调推理时代的容量瓶颈。这些方向共同指向一个结论:国产AI基础设施必须按系统来做。
系统化的难点在于,客户最终关心的是模型能不能稳定上线、延迟能不能达标、成本能不能算清、现有软件能不能迁移。单点硬件突破如果没有编译器、算子库、调度框架、监控体系和应用适配配合,很难形成可持续交付。反过来,只要系统效率足够高,即使单芯片暂时不占绝对优势,也可能在特定场景里跑出更好的总成本。国产算力真正的机会,不是复制一套昂贵路线,而是围绕可部署、可维护、可扩展重新设计基础设施组合。
应用压力
上层应用的变化也会反向推动底层重构。快手电商上线AI购物助手,把智能选品和对话内加购放到商品搜索场景里;谷歌白皮书强调Agent生产力来自Context、Skills与Harness;TeleAgent星辰超级智能体面向普通职场人提供安全可靠的办公工具。这些应用都需要低延迟、多轮上下文、稳定调用和可控成本,底层基础设施稍有瓶颈,体验就会立刻掉下来。
当AI从演示走向交易、办公和业务流程,系统不再能容忍“偶尔慢一点、偶尔失败一下”。电商助手要影响成交,办公Agent要处理文件和流程,企业智能体要接入权限、审计和安全策略,它们背后都需要更可靠的推理服务。网络直通、内存分层、GPU扩容和软件栈优化,本质上都是为了让上层应用从“能用”走向“好用、常用、敢用”。
下一步竞争
AI基础设施的下一步竞争,很可能不再由单一指标定义。谁的模型参数更大、谁的芯片峰值更高、谁的数据中心规模更夸张,都只能解释一部分问题。真正影响商业结果的,是每美元能换来多少稳定可用的智能,每瓦电能支撑多少有效请求,每一次模型调用能不能被可靠交付到业务场景里。
国产GPU直通RDMA网卡、HBF高带宽闪存、Databricks扩充GPU容量、Token利润向上游集中,这些资讯共同指向一个更朴素的判断:AI行业正在从“模型故事”进入“系统账本”。模型仍然重要,但算力、内存、网络、数据和工程交付会越来越决定模型能不能变成生意。接下来真正值得看的,不是谁又喊出一个更大的参数,而是谁能把复杂基础设施做成用户感受不到的稳定能力。







暂无评论内容