机器人开始计算Physical Token,AI竞争从参数转向真实世界反馈

机器人要真正走进工厂、家庭和商店,最难的可能不是让它学会一个动作,而是让它学会用更低的代价持续获得新动作。2026世界机器人大会上,跨维智能提出“Physical Token经济学”,把通用物理智能的规模化问题换成一个很现实的指标:机器人每获得一项新技能,边际成本能不能继续下降。这个判断,比单纯比较模型参数更接近产业现场。因为机器人每一次失败都可能消耗真机时间、人工标注、设备维护和安全验证,所谓智能,最终要在这些账本上成立。

3D rendered abstract eco-system depicting nature and technology symbiosis.

这条主线正在被多组新产品和研究同时验证。具身世界模型开始预测视觉、触觉和环境变化,机器人训练从任务清单转向物理规律;乐鑫发布模块化开发板,把自然语言编程接到真实设备;Qwen3.8-27B则把较强的多模态和Agent能力压缩到消费级显卡可以承受的范围。AI竞争并没有离开模型,但模型的价值正在由“能不能生成”转向“能不能在真实环境里反复工作”。

机器人先要算清成本

Physical Token经济学的核心,不是给机器人增加一种新的计量单位,而是提醒行业重新定义规模化。语言模型可以用Token衡量输入输出,物理智能则要面对动作、场景、失败和恢复。机器人要学会整理桌面,可能需要看到不同材质、不同高度和不同摆放方式;要学会在工厂搬运,又必须处理遮挡、碰撞、抓取误差和突发停机。每种变化都意味着新的数据和验证成本。

跨维智能提出,降低这类成本需要同时依靠统一数据表达、生成式仿真和真实部署闭环。统一表达让不同机器人、传感器和任务产生的数据可以互相利用;仿真让大量危险或昂贵的失败先在虚拟环境中发生;真机部署则负责把最有价值的难例带回训练系统。三者缺一不可。只做仿真,模型可能学会理想化世界;只做真机,训练速度和安全成本又难以接受。

世界模型进入训练环

章鱼动力发布的SYNWorld V0.5,试图把语言、视觉和触觉放进同一个具身世界模型中。该模型采用多模态DiT架构,基于超过30万小时异构数据进行预训练,并将参数规模做到百亿级。它的意义不在于又增加了一个模型名字,而在于机器人不必每次都直接把策略丢进真实环境,可以先在世界模型中观察动作可能带来的结果。

Current Robotics的CurrentWorld-0也沿着类似方向推进,将跨本体、跨视角以及力觉、触觉预测整合到一个交互式仿真系统。移动机器人、双足人形和其他设备可以在其中接受训练和评测,策略先经历模拟、失败和比较,再把关键问题带回真机。对于机器人团队来说,这意味着评测不再只是项目结束时的一张成绩单,而可能成为持续产生训练数据的入口。

从任务清单到物理反馈

过去的机器人演示通常围绕固定任务展开:抓起一个杯子、走过一段路线、完成一次分拣。固定任务容易展示,也方便做成功率统计,但真实环境很少按照脚本运行。杯子可能被遮住,地面可能有水,物体重量可能与训练数据不同,人在旁边移动还会改变机器人的安全边界。机器人真正需要的不是背熟一份任务清单,而是理解动作为什么有效,什么时候需要重新规划。

北大与微软亚研提出的BCP,为视觉语言动作模型增加了一个轻量级规划头,让模型自己决定执行多久以及何时重新规划。在RoboTwin 2.0上,成功率从89.88%提升到93.94%,真机挂马克杯任务的成功率从44%提升到84%。这类改进看起来不像更大的底座模型那样夺眼球,却更贴近产品质量:减少不必要的重规划,可以降低延迟;在关键时刻重新判断,又能避免机器人沿着错误路径继续执行。

端侧设备接住模型输出

乐鑫发布ESP-Mosaico模块化开发板,把AI Coding从屏幕里的代码编辑器带到真实硬件。它搭载ESP32-S3芯片,配备触控屏,并支持摄像头、传感器、电机和其他功能模块的组合。Chat Coding负责根据自然语言快速生成原型,Vibe Coding则把构建、部署、测试和修改串成持续迭代的过程。对开发者而言,代码不再只需要通过语法检查,还要在设备上接受输入、功耗、响应和故障测试。

这类端侧探索与大模型压缩形成了同一条产业链。Qwen3.8-27B采用27B参数规模,经过4bit量化后可以在单张RTX 4090上运行,并在软件工程和操作系统任务评测中表现突出。它未必意味着所有前沿能力都能被搬进家用设备,但说明开源模型的竞争已经从“有没有权重”走向“普通团队能不能部署、调试和改造”。模型只有进入开发板、工作站或企业内网,才会产生足够多的真实反馈。

可玩产品也是一种验证

Spellcaster把六个Agent分工到规则、关卡、素材、可玩性、模拟和修复环节,尝试让用户用自然语言生成可玩的游戏。它与只输出代码的编程助手不同,交付标准不再是文件能否运行,而是玩家能不能开始游戏、理解规则并愿意继续玩。基础小游戏最快约15分钟生成,这个速度本身不是终点,真正值得观察的是系统能否通过试玩发现问题,再自动调整关卡和交互。

Nex Playground则把端侧视觉识别放进家庭娱乐设备,通过摄像头识别玩家动作,支持多人参与。相关数据显示,该产品累计销量已经超过百万台,并采用硬件加订阅内容的商业模式。它的挑战与机器人相似:光有一次准确识别不够,还要适应不同光线、房间、身高和遮挡,并持续提供让用户愿意回来的内容。AI产品的复购和留存,本质上也是对模型稳定性和反馈闭环的长期测试。

基础设施要跟上反馈

当AI系统开始调用仿真器、传感器、浏览器、代码运行环境和真机设备,基础设施的角色就会发生变化。过去部署模型,重点往往是显存、吞吐和接口;现在还要考虑任务队列、数据版本、回放日志、失败重试、设备权限和结果审计。一个机器人策略即使平均成功率很高,只要失败时没有留下可分析的轨迹,下一轮训练就很难真正进步。

企业在部署这类系统时,也不应只比较某个模型的榜单分数。需要先拆分任务:哪些请求适合端侧完成,哪些需要云端GPU,哪些环节必须保留人工确认,哪些数据需要隔离。对于中小团队,可以先用具备弹性扩展能力的速维云云服务器验证模型推理、仿真和日志链路,再根据真实并发和显存占用决定是否建设专用集群。这样计算的不是一台机器的价格,而是一项技能从训练到上线、从失败到修复的完整成本。

模型能力要接受现实检验

从Physical Token到世界模型,再到端侧开发板和可玩游戏,几条看似不同的新闻指向同一个结论:AI的下一个竞争单位,正在从模型回答变成可重复完成的结果。机器人要在物理世界里完成动作,科研系统要让实验数据验证假设,硬件平台要让代码在真实设备上运行,游戏生成器要让用户真正玩起来。每一种产品都在把模型输出送进环境,再把环境反馈带回系统。

因此,参数量仍然重要,却不能单独代表产品上限。更值得观察的是数据是否能持续回流,仿真是否能覆盖难例,部署是否能控制成本,失败是否能被定位,人工是否能在关键节点介入。谁能把这些环节组织成稳定的闭环,谁就更可能把一次令人惊叹的演示变成长期可用的服务。AI真正走向产业化的标志,不是模型又大了一圈,而是它在现实世界里学会了少犯错、快恢复,并且每获得一项新能力都比上一次更便宜。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享