τ0-VLA把世界模型推演接入机器人决策层,这件事比单纯刷新一个机器人评测分数更值得关注。上海创智学院罗剑岚团队与智元机器人提出的“慢思考—快执行”分层架构,试图让机器人在行动前先在内部世界里推演后果,再把高层计划交给低层控制去执行。对具身智能来说,这意味着竞争焦点正在从“能不能做一个漂亮动作”,转向“能不能连续理解任务、规划步骤、处理意外并稳定完成”。

同一组资讯里,宇树轮足机器人As2-W用25公斤机身承担150公斤负载、平地速度超过6m/s、续航33公里;新智具身与复旦大学又用3万小时触觉数据补齐机器人的“手感”;RSS大会上的具身辩论则继续追问世界模型、策略模型、互联网视频和真机数据到底应该怎样组合。几条线索拼在一起看,机器人正在从舞台Demo进入更难的系统工程:脑子、身体、感知、数据和算力都要一起补课。
长程任务
τ0-VLA最核心的变化,是把世界模型推演放进上层决策。传统VLA模型强调视觉、语言和动作的直接映射,机器人看到场景、理解指令,然后输出动作。但多步骤任务经常不是“一眼看见就能做完”的问题:拿杯子、避开障碍、打开柜门、把物体放到指定位置,每一步都会改变环境,前一步的小误差也会影响后一步。没有内部推演,机器人很容易在短动作上表现不错,却在长流程里越做越乱。
“慢思考—快执行”的分层思路,恰好对应这个痛点。慢思考负责计划、预测和纠错,快执行负责具体控制和实时反应。团队使用40115小时真实物理交互数据,其中超过2万小时来自真机数据,让模型不仅看过视频,还接触过真实机器人与环境互动的反馈。实验中,多步骤长程任务成功率从27.5%提升到45.0%,数字还谈不上终局,但方向很清楚:具身智能不再只追求单步动作漂亮,而是开始追求任务链条稳定。
身体能力
如果说τ0-VLA补的是“思考系统”,宇树As2-W展示的则是身体能力正在快速变强。这台轮足机器人把四足结构和轮式移动结合起来,平地可以高速滑行,复杂地形又能依靠腿部跨越高台、通过陡坡。25公斤机身承重150公斤的表现,让它不只是一个视频里会翻跟头的机器狗,而更接近可承担巡检、搬运、应急和户外移动任务的通用平台。
更重要的是,硬件平台开始为大模型和边缘算力预留接口。As2-W支持150 TOPS算力拓展,这说明机器人公司已经不满足于“机械结构先行、智能后补”的旧路线。未来机器人是否好用,很大程度取决于身体、传感器、控制算法和上层模型能不能协同设计。速度、负载、续航、越障能力解决的是“能不能到达现场”,而VLA、世界模型和任务规划解决的是“到了现场知道怎么做”。
触觉补课
机器人要在真实世界里干活,只看见还不够。新智具身联合复旦大学发布的N0系列技术报告,把焦点放在触觉数据上:超过3万小时触觉数据底座、统一触觉“方言”的N0-Foundation、把触觉预判接入VLA的N0-VTLA,以及在世界模型中重构触觉想象的N0-TWAM。插插头成功率达到85%、仿真成功率达到84.5%,这些指标背后,是机器人开始补足人类很自然、机器却长期欠缺的“手感”。
触觉的重要性在于,它能告诉机器人“接触是否发生”“力度是否合适”“物体是否滑动”“插口是否对齐”。很多任务用视觉看起来很简单,真正执行时却高度依赖微小接触反馈。比如插头插入插座、拧紧瓶盖、拿起软质物体、整理线缆,视觉只能提供大概位置,触觉才能让动作进入最后几毫米的精细区间。世界模型如果只懂画面,不懂接触,就很难形成可靠的物理预测。
数据路线
RSS大会上的具身辩论把行业分歧摆到了台面上:世界模型和策略模型是否应该分开,动作控制与像素预测哪个更关键,互联网视频和机器人真机数据应该如何取舍。投票结果倾向于世界模型与策略模型分离,也认可互联网视频在当前阶段的价值。这说明行业并不认为所有能力都必须从昂贵真机数据里学出来,海量视频仍然是理解场景、物体关系和人类行为的重要来源。
但互联网视频不是万能答案。视频能让模型看见“人是怎么做的”,却无法完整记录手指力度、关节扭矩、接触摩擦和失败后的恢复动作。真机数据昂贵、采集慢、覆盖窄,却能提供机器人真正执行任务时必须面对的物理细节。更现实的路线可能是:用互联网视频学习世界常识和行为先验,用仿真扩大试错范围,再用高质量真机数据校准动作、触觉和安全边界。具身智能的胜负,不会由单一数据源决定,而会由数据配方决定。
走向系统工程
具身智能的下一步,可能不再是某个模型单点突破,而是系统工程的综合成熟。Prentis专注电脑操控Agent,OpenAI推出企业Agent部署产品Presence,飞书深诺Marvy 2.0把营销任务拆成多个Agent协同,这些软件侧进展也在提醒机器人行业:真正可用的智能体,需要任务拆解、工具调用、安全护栏、评估反馈和持续改进。机器人只是把这些复杂度搬到了物理世界,容错空间更小、验证成本更高。
这也是为什么τ0-VLA、As2-W和触觉数据底座放在一起格外有意义。一个能长期工作的机器人,既要有能走能扛的身体,也要有能预测后果的世界模型,还要有能感知接触的触觉系统,并且需要稳定的任务管理和安全边界。单个炫技视频可以制造传播,真正的产业落地却要回答更朴素的问题:能否连续工作、能否失败恢复、能否被低成本部署、能否让用户信任。
产业影响
从商业化角度看,长程具身智能最先落地的场景大概率不是家庭万能机器人,而是任务边界更清晰、环境更可控、价值密度更高的行业场景。仓储、巡检、制造、安防、园区运维、实验室自动化,都比开放家庭环境更适合早期部署。轮足移动平台负责进入复杂现场,VLA与世界模型负责拆解任务,触觉与精细控制负责完成末端操作,这套组合一旦稳定,机器人就会从“展示设备”变成“生产工具”。
不过,行业仍要警惕两类泡沫。第一是把单次演示包装成通用能力,忽略失败率、维护成本和环境限制;第二是把大模型能力直接等同于机器人能力,忽略硬件、控制、数据闭环和安全验证。具身智能确实在加速,但它不是一场只靠参数规模就能赢的比赛。谁能把思考系统、身体平台、触觉反馈、数据闭环和工程化部署真正接起来,谁才更可能在下一阶段跑出来。
整体来看,机器人行业正在从“让机器动起来”,进入“让机器想清楚再行动”的阶段。τ0-VLA给出了上层思考系统的样板,宇树As2-W展示了身体平台的进化,触觉数据底座补上了真实接触中的关键缺口。接下来,具身智能的看点不只是某个机器人又完成了一个高难动作,而是它能否在真实任务里稳定、连续、可解释地完成工作。这才是机器人从视频热闹走向产业价值的分水岭。






