Meta联合研究团队发布HumanCLAW后,具身智能面临的短板被一组数字直接摊在桌面上:9个前沿视觉语言模型在“找到目标、靠近目标、完成交互”三个阶段的成功率分别为64.9%、42.5%和16.8%。模型已经能够识别房间里的物体,也能大致判断该往哪里走,但只要任务要求它持续追踪自身位置、调整动作并真正碰到目标,成功率就会快速下滑。
这比单纯比较视觉问答得分更接近机器人落地的真实难度。一个家庭机器人认出水杯,不等于它能绕开桌角走过去,更不等于它能以合适力度拿起杯子。HumanCLAW把高层决策与低层运动控制拆开测试,揭示了具身AI最关键的断层:模型“看懂世界”的速度,明显快于它“在世界里稳定行动”的速度。
16.8%的现实门槛
具身任务是一条连续链路,前一步的微小误差会在后续动作中被放大。模型可能正确识别目标,却在接近时失去目标;也可能走到正确位置,却没有意识到机械臂当前的姿态不适合抓取。HumanCLAW中完整交互成功率只有16.8%,说明当前视觉语言模型缺少稳定的“具身自我感知”:它知道外部环境有什么,却不能持续理解自己的身体处于什么状态。
这类问题无法靠增加一条提示词解决。机器人需要把摄像头、深度、关节角度、力觉和历史动作放进同一状态模型,还要判断哪些变化来自环境,哪些变化是自己造成的。对开发团队而言,评测指标也必须从“目标识别是否正确”改成任务完成率、碰撞率、恢复成功率、平均动作次数和人工接管频率,只有这些指标才能反映系统是否真的可用。
决策与控制分层
HumanCLAW将高层行动决策和低层运动控制分开评估,意义不只是方便跑分,而是为工程系统划出更清晰的责任边界。大模型适合理解自然语言、识别目标并规划步骤,低层控制器则更擅长处理毫秒级反馈、轨迹约束与关节稳定。让一个模型包办全部环节看似简洁,实际容易在错误发生时找不到原因。
分层之后,系统可以判断失败究竟发生在“选错目标”“路线规划错误”,还是“抓取动作不稳”。高层计划也可以在低层反馈异常时重新规划,而不是机械执行到底。对于工厂、仓库和家庭场景,这种结构更容易设置安全边界:速度、力度和活动范围由确定性控制器限制,语言模型负责更灵活的意图理解与任务拆解。

精密操作补上触觉
南洋理工大学团队研发的Facet-0展示了另一条务实路线:在视觉与语言之外加入六维力觉信息,让机器人在精密装配时感知接触状态。模型面对插接、对齐等毫米级任务时,不仅要“看见”零件,还要通过受力变化判断是否卡住、是否偏斜,以及应该继续推进还是退回重试。
在五项真实装配任务中,Facet-0达到82%的成功率,放置精度为0.5毫米;经过强化学习后,失败恢复率从44%提升到81%,人工干预率从47%降至24%。这里真正有商业价值的不是一次漂亮演示,而是恢复能力。工业现场不可能保证每个零件位置完全一致,能发现失败并主动修正,才意味着机器人有机会从固定自动化设备变成可复用的生产单元。
数据采集换一种思路
机器人学习长期受制于真机数据昂贵、采集速度慢和设备磨损。自变量发布的TwinDex尝试把数据采集装置与实际执行结构做成同构系统,让训练数据更容易迁移到机器人本体。其后训练阶段没有使用真机遥操作数据,只凭数百条无本体数据完成包含24个子动作的化学实验任务,采集效率达到传统遥操作的5.3倍。
这并不意味着真机验证可以消失,而是说明数据生产方式正在变化。未来更合理的路径可能是:先用低成本装置、仿真环境和公开视频扩大动作覆盖,再用少量真机数据校准动力学差异,最后通过真实任务回收失败样本。谁能建立这样的闭环,谁就能更快覆盖新零件、新工具和新工作台,而不是每换一个场景都从头遥操作数千次。
生态规模不等于协同
小米在IFA展示“人车家全生态”物理AI能力,IoT平台连接设备超过11.6亿台,覆盖130多个品类和2000多个SKU。庞大的设备数量为物理AI提供了真实入口:手机可以理解用户意图,汽车、家电和可穿戴设备则成为可被调度的执行节点。与单台机器人相比,这种生态更容易先在固定设备上形成可控自动化。
但设备接入数量并不会自动变成智能协同。不同设备的状态定义、权限模型、响应延迟和故障处理方式并不一致。一个“回家前调好环境”的任务,可能涉及车辆位置、门锁授权、空调状态和家庭成员隐私。平台必须让每一步都有明确授权、状态回读和失败兜底,不能只依赖模型猜测设备是否执行成功。物理AI越接近生活,权限与安全就越需要被设计成产品基础能力。
人才开始向世界模型集中
理想汽车引入世界模型专家刘宇负责具身行为研发,也反映出汽车公司对机器人“大脑”的投入正在加速。自动驾驶积累的多传感器感知、路径规划、仿真训练和安全冗余,与具身机器人高度相关;但机器人还要面对手部操作、室内复杂物体以及人与设备的近距离协作,任务开放度远高于道路驾驶。
世界模型的作用,是让系统在行动前预测可能结果,并在实际反馈与预测不一致时修正计划。它不是给机器人生成一段想象视频,而是提供可用于决策的状态变化模型。未来竞争重点将从“能否完成某个演示动作”转向“能否在陌生环境中预测、试错、恢复,并把经验迁移到新的身体和工具”。这也解释了为什么具身赛道同时争夺算法人才、仿真平台与高质量动作数据。
落地先看闭环
对于准备引入机器人的企业,最需要避免的是被单段演示视频带偏。采购评估应从完整任务链开始:目标是否能稳定识别,移动过程中是否持续定位,接触后是否能根据力觉调整,失败时能否退回安全状态,人工接管是否方便。单项能力再强,只要链路中最弱的一环成功率过低,整套系统就无法稳定创造价值。
HumanCLAW的16.8%并不是具身智能没有前景,反而给行业提供了更真实的坐标。视觉语言模型已经把高层理解推进到可用边缘,接下来决定落地速度的,将是状态感知、低层控制、数据闭环、失败恢复与权限治理。AI进入物理世界后,答案不再由文字是否流畅决定,而要由每一次移动、抓取和协作能否被现实验收。





