Acrab在WAIC发布Agent Box个人AI中心,把“本地跑千亿参数模型”重新推到行业中心。这个产品的卖点不只是把一台小盒子放上桌面,而是试图让Agent拥有持续上下文、工具调用、多Agent协作和本地算力账本:过去依赖云端API、按Token付费、受网络和隐私边界限制的工作流,开始出现另一种形态——把一部分推理能力搬回办公室、工作台和个人设备。
同一组重点资讯里,元川微完成数亿元融资,押注面向Agent时代的LPU推理芯片;OpenAI计划投入巨额资金建设数据中心并锁定大规模电力;超聚变推出桌面级TokenBox与Token Factory;美团用5万张国产卡训练万亿参数LongCat-2.0。它们看似分属硬件、芯片、云基础设施和模型训练,放在一起却指向同一个变化:AI竞争正在从“谁的模型更强”扩展为“谁能更稳定、更便宜、更靠近任务现场地提供算力”。
桌面算力入场
Acrab Agent Box最值得关注的地方,是它把个人AI中心包装成一种新入口。公开信息显示,这台设备基于GΞLIX 1平台,可本地运行千亿参数模型,并提供650 TOPS算力。对普通用户来说,参数和TOPS只是数字;真正重要的是,当模型能在本地持续运行,Agent就不必每一步都把上下文送到云端,也不必把所有任务都拆成一次次API调用。
这会改变AI产品的使用方式。云端大模型适合处理通用问答、复杂推理和跨平台服务,但本地设备更适合长期保存个人上下文、连接本地文件、承接高频低延迟任务。比如代码项目、企业资料、会议纪要、设计素材、客户文档等内容,如果都要频繁上传云端,成本、合规和体验都会成为阻力。本地AI盒子的出现,说明厂商正在寻找“云端大脑+本地执行层”的组合,而不是把所有能力都压在远端服务器上。
推理芯片补位
元川微的新一轮融资让“推理芯片”成为另一个关键线索。这家公司由华为背景团队创立,核心方向是面向Agent时代的LPU架构,强调时空编译器、硬流水架构和大带宽存储。相比训练芯片,推理芯片更直接影响AI应用能否大规模落地,因为用户真正每天消耗的不是发布会里的训练算力,而是每一次对话、每一次代码生成、每一次图片理解和每一次工具调用背后的推理成本。
Agent应用尤其吃推理。传统聊天机器人可能一次请求给出一个答案,而Agent需要规划、检索、调用工具、观察结果、修正计划,再继续执行。一个任务可能包含几十次甚至上百次模型调用,如果每一步都依赖昂贵的云端GPU,产品毛利很容易被Token成本吞掉。LPU这类专用推理架构要解决的,就是让多模态、MoE和低延迟推理更适合真实业务,而不是只在实验室跑分里好看。
云端仍是底座
本地算力升温,并不意味着云端数据中心退场。OpenAI计划在佐治亚州投入超300亿美元建设数据中心、锁定3.2GW电力供应,恰恰说明前沿模型仍然需要极重的基础设施。更大模型、更长上下文、更复杂多模态和更强Agent能力,背后离不开长期电力、服务器、网络、散热和资金投入。AI竞争走到今天,已经不是单纯的软件生意,而是能源、地产、芯片、工程和资本共同参与的基础设施竞赛。

但云端算力的角色会发生变化。过去很多AI应用默认把全部能力放在云上,用户只负责打开网页或App。现在更合理的形态可能是分层:云端承担最强模型、统一训练、复杂推理和跨企业服务;本地设备承担隐私数据、低延迟交互、高频任务和离线能力;企业私有部署负责合规、权限和内部工作流。算力不再只有一个中心,而是在云、边、端之间重新分工。
Token工厂思路
超聚变发布FusionOne AI和桌面级TokenBox,把“Token工厂”这个概念讲得更直白。AI产品过去常把Token当成技术指标,但在企业场景里,Token就是产能,也是成本。一个研发团队每天让AI写代码、检查Bug、生成测试、整理文档;一个客服团队让AI处理咨询、总结工单、生成回复;一个内容团队让AI生产图文和视频脚本,这些都会转化成真实的Token消耗。
当Token调用量迅速增长,企业就会追问三个问题:算力是否稳定,单位成本能不能降下来,产出的结果能不能被审计和复用。TokenBox这类桌面或企业侧设备,不一定要替代所有云服务,但可以承接一部分高频、固定、可预测的任务。它的价值类似企业内部的“AI发电机”:不是追求一次性跑出最强答案,而是持续、稳定、低成本地产出可用Token,让AI从试用工具变成日常生产资料。
国产算力验证
美团LongCat-2.0在5万张国产算力卡上完成万亿参数模型训练,给这条主线补上了另一块拼图。训练万亿模型本身就是系统工程,涉及芯片集群、通信、调度、容错、数据管线和工程团队协作。它的意义不只在于发布一个大模型,而在于验证国产算力集群能否承接更复杂的大规模训练任务,也让AI人才、模型能力和基础设施绑定得更紧。
这类进展会影响国内AI生态的选择。过去企业做大模型常常被卡在算力供给和成本波动上,如果国产算力集群的可用性继续提高,模型公司、云厂商和应用团队就有更多部署组合。它也会推动工具链成熟:编译器、通信库、集群管理、模型并行、故障恢复和推理优化,都会从“能跑”走向“稳定跑、低成本跑”。AI行业真正的壁垒,往往不是单个模型参数,而是把模型训练、部署和服务持续跑起来的系统能力。
入口正在重排
研究人员让CUDA源码通过中间层跑上苹果GPU,也让人看到端侧算力的另一个方向。虽然这类技术验证距离大众产品还有距离,但它说明开发者正在想办法打破硬件生态之间的墙,让更多设备参与AI计算。未来办公室里的PC、Mac、手机、桌面AI盒子、企业服务器和云端集群,可能都会成为同一套AI工作流里的不同节点。
这正是本轮算力变化最值得注意的地方:AI入口不只属于聊天窗口,也不只属于云平台。谁能把模型能力放到更接近用户任务的位置,谁就更容易获得真实使用场景。Agent Box、LPU、TokenBox、数据中心和国产算力集群分别回答了不同问题:本地怎么跑,推理怎么省,企业怎么稳定供给,前沿模型怎么继续扩张,国产生态怎么补齐底座。AI算力战已经从单点堆GPU,变成云、边、端共同竞争的长期工程。






