李飞飞团队把触觉传感器接进机器人手部之后,机器人终于不再只靠“看见”来猜测世界。T-Rex 研究中,高频触觉反馈被用于抓取、接触、挤压和细微调整等任务,十二项任务平均成功率达到 65%,相较强基线提升约 30 个百分点。这个结果不只是机器人论文里的一个漂亮数字,它更像是在提醒行业:如果具身智能真的要进入家庭、工厂、仓储和服务场景,光有大脑和眼睛远远不够,机器还需要知道自己碰到了什么、力度是否合适、动作有没有偏离。
同一批资讯里,AXIS 数据引擎用网页众源仿真轨迹验证机器人训练数据的价值,INTACT 通过从运动意图直接生成动作把规划延迟压到毫秒级,黄仁勋也再次强调物理 AI 与机器人市场的长期空间。几条消息放在一起看,具身智能正在从“能不能演示一个动作”走向“能不能稳定完成一类任务”。这背后的关键,不再只是模型参数、视频理解或动作库规模,而是视觉、触觉、意图规划、数据覆盖和真实部署之间能否形成闭环。
机器人开始补手感
过去几年,机器人研究最容易被看见的进展通常来自视觉和语言:模型能看懂桌面,能听懂指令,能把“拿起杯子”拆成一串动作。但在真实世界里,很多任务的难点并不在“看懂”,而在“碰对”。杯子可能是空的也可能是满的,牙膏管软硬不同,麻将牌的边缘很薄,布料、塑料、金属和食物的触感完全不同。只靠视觉判断,机器人往往要在动作失败之后才知道自己用力过猛或接触位置不对。
T-Rex 的意义就在这里。它把视觉和触觉拆成不同节奏来处理:视觉负责判断目标和大方向,触觉则以更高频率反馈接触状态,帮助机器人在动作过程中实时修正。人类拿东西时不会每一毫秒都重新看一遍手指,而是依靠指尖压力、摩擦和微小滑动判断是否抓稳。机器人如果要从“摆拍式成功”走向“日常式可靠”,也必须补上类似的反馈通道。
成功率背后的工程含义
十二项任务平均成功率 65% 听起来还没有到商业化产品可以放心交付的水平,但它真正有价值的地方在于提升幅度和问题方向。相较强基线提升约 30 个百分点,说明触觉不是锦上添花,而是在很多接触密集型任务中直接改变了上限。对于机器人来说,推开抽屉、拧动旋钮、抓取易碎物、挤压软包装、整理桌面杂物,都属于视觉信息不充分、接触反馈很关键的任务。
这也让具身智能的竞争从单一模型能力转向系统工程。模型需要理解语言指令,视觉系统需要识别对象和位置,触觉系统需要捕捉接触变化,控制系统还要把这些信号实时转成动作调整。任何一环延迟太高、噪声太大或反馈不稳定,最后都会体现在任务失败上。换句话说,机器人不是把一个大模型塞进机械臂就能解决的产品,而是一个由传感、控制、推理和安全约束共同组成的复杂系统。
数据不只是越多越好
AXIS 数据引擎给出了另一条重要线索:机器人模型训练并不是单纯堆数据量。Axis Robotics 联合多所高校用 150 万条网页众源仿真轨迹做验证,完整数据集让成功率从 83.9% 升至 88.8%。这个提升说明众源轨迹确实有价值,但研究也指出,持续收益的关键来自任务覆盖、行为多样性和数据增强,而不是把同质化样本无限堆高。
这对具身智能很现实。真实世界里的任务分布极其分散,同样是“拿起物体”,厨房、仓库、实验室、商店货架上的物体形态和摆放方式都不同。如果训练数据只覆盖少量场景,机器人在演示间里表现很好,换到真实环境就容易失灵。AXIS 强调的覆盖和多样性,实际上是在回答“机器人怎么从少数 Demo 走向泛化能力”。数据越接近真实任务分布,模型越有机会学到稳定策略,而不是背下某几个固定动作。

规划速度决定能否实时工作
机器人要在真实环境里工作,规划速度同样绕不开。传统世界模型方法常常需要在大量候选动作中搜索,计算成本和延迟都很高。浙大、清华等团队提出的 INTACT 选择从运动意图直接生成动作,把规划延迟从秒级压到毫秒级,并在四项任务中取得 95.33% 的平均成功率。这个方向和触觉反馈并不冲突,反而互相补位:触觉解决“接触之后如何微调”,快速规划解决“下一步动作如何及时生成”。
在工业、物流和服务机器人场景里,毫秒级响应非常关键。机械臂抓取物体时,如果传感器发现滑动,控制策略必须立即调整;移动机器人避障时,如果规划延迟太高,就会错过最佳动作窗口。具身智能真正落地时,用户不会关心模型论文里用了多少技巧,只会关心它会不会慢半拍、会不会撞到东西、会不会把物品捏坏。规划、反馈和控制越接近实时,机器人越有机会进入高频任务。
商业化仍要跨过可靠性门槛
黄仁勋在访谈中提到,机器人可能成为英伟达下一个千亿美元市场,物理 AI 业务也已经接近百亿美元规模。资本和产业当然愿意押注这个方向,因为一旦机器人能稳定替代或协助人类完成部分任务,影响的不只是消费电子,而是制造、仓储、清洁、医疗辅助、农业和城市服务等一整套物理世界工作流。问题在于,物理 AI 的商业化门槛比纯软件更高,它必须同时满足可靠、安全、可维护和成本可控。
这也是为什么触觉、数据和规划这些看似“底层”的进展,比单次炫技视频更值得关注。机器人进入真实场景后,失败不是回答错一句话,而可能是撞坏设备、伤到人、污染样品或造成停线。企业客户会要求稳定指标、故障处理、远程运维、备件供应和安全责任边界。具身智能要变成可采购的生产力,必须把实验室里的成功率继续推高,并用工程体系把偶发失败压到可接受范围内。
应用与内容侧也在扩散
在硬核机器人之外,AI 应用层也在快速扩散。前 Meta 企业 AI 负责人 Clara Shih 创办 New Work Foundation,用免费 AI 工具帮助年轻人理解职业方向、匹配岗位优势和获取招聘标准;金山办公把“边聊边改”文档能力带到 ChinaJoy,让 AI 办公从生成草稿进一步走向直接修改文档;AI 选秀节目播放量破亿,也说明生成式内容正在进入更大众的娱乐消费场景。
这些应用和机器人主线看似距离很远,其实都指向同一件事:AI 正在寻找更具体的使用环境。办公 AI 要嵌进文档,求职 AI 要嵌进职业数据库和岗位流程,内容 AI 要嵌进社区投票和商业赞助,机器人则要嵌进传感器、机械结构和真实空间。聊天框仍然重要,但它已经不是唯一入口。下一阶段,谁能把 AI 放进合适的工作流,谁就更容易形成用户习惯和商业收入。
具身智能进入系统战
机器人拥有“手感”之后,具身智能的竞争逻辑会变得更立体。模型公司需要更强的多模态理解,硬件团队需要更可靠的传感器和执行器,数据团队需要构建覆盖丰富场景的训练集,应用团队还要找到愿意为可靠性付费的真实客户。单点突破仍然重要,但真正决定行业进度的,会是这些能力能否组合成稳定系统。
这意味着具身智能不会一夜之间把所有机器人带进家庭,却会先在任务边界清晰、经济价值明确、风险可控的场景里持续推进。仓储分拣、工业上下料、实验室辅助、清洁服务和医疗康复都有机会成为早期落点。触觉反馈、众源轨迹和毫秒级规划共同说明,机器人正在补齐从“看见世界”到“接触世界”的关键环节。等机器真正学会感知力度、理解意图并实时修正动作,物理 AI 才算开始走出展示台,进入能反复工作的现实现场。







暂无评论内容