机器人不再只会Demo,具身智能开始补上真实工作流

机器人赛道这次热闹得有点不一样:优艾智合用 1B 参数模型 FabriVLA 登顶 Meta-World MT50,灵初智能发布双灵巧手通用操作大模型 EgoSteer,科大讯飞新公司爻方智能把“本体认知”摆到机器人认知框架中心,PhyAgentOS 又把物理智能模型和异构机器人调度底座开源出来。几条消息连在一起看,重点已经不是展台上能不能做一个漂亮动作,而是机器人能不能在不同任务、不同本体、不同环境里稳定复用能力。

A sleek bus passes by a modern glass building under a bright blue sky.

过去具身智能最容易被质疑的地方,正是“Demo 很惊艳,落地很困难”。一个机器人能倒水、夹物体、打乒乓球,并不代表它能在工厂、仓库、办公室或家庭里长期可靠工作。现在新的变化是,行业开始同时补三块短板:模型要更轻、更能泛化;数据管线要能处理真实人类操作经验;系统底座要能把任务、模型、硬件和安全约束接起来。机器人正在从单点炫技,转向可训练、可部署、可评测的工程系统。

轻量模型登榜

优艾智合的 FabriVLA 最值得关注的一点,是它并没有靠超大参数去堆成绩。公开信息显示,这个 1B 参数模型在 Meta-World MT50 测试中达到 90% 成功率,超过 π0 等国际模型。对具身智能来说,参数规模越小,越有机会部署到边缘设备、工业机器人和真实产线,因为机器人现场往往不能无限依赖云端推理,也不能接受过高延迟。

这背后代表的是一种更务实的路线:机器人模型不仅要“聪明”,还要“装得下、跑得起、反应快”。如果一个模型只能在昂贵服务器上完成实验室任务,它的商业价值会被部署成本限制;如果一个较小模型能通过视觉融合、门控自注意力等架构优化拿到稳定表现,它就更接近工厂、物流和巡检场景真正需要的形态。优艾智合同时提到 FabriX 大模型与隙锋人形机器人订单,也说明具身智能竞争正在从论文榜单逐渐接近产品交付。

灵巧手补上操作能力

灵初智能与北大-灵初联合实验室发布的 EgoSteer,把重点放在双灵巧手通用操作上。机器人要进入真实世界,移动只是第一步,真正难的是用手和环境发生稳定交互。拿、捏、推、拉、翻转、配合工具,这些动作对人类来说很自然,对机器人来说却涉及视觉理解、力控、动作规划、失败恢复和长序列执行。

EgoSteer 的价值不只是“会做更多动作”,而是它配套了数据管线 EgoSmith、世界模型增强 VLA 和 Robot-Stack 系统。9.6K 小时人眼视频被处理成训练资源,意味着团队在尝试把人类第一视角经验转化成机器人可学习的操作知识。40 个任务 75% 成功率、少量示范即可泛化新任务,这些指标还不能说明机器人已经无所不能,但它们说明灵巧手正在从“机械结构很复杂”走向“操作策略可迁移”。

本体认知成为新关键词

科大讯飞成立爻方智能,并在技术报告 iFLYTEK-Embodied-Omni 中提出“本体认知”,这个概念戳中了机器人落地的核心问题。很多机器人系统能看懂外部世界,却不够理解自己的身体:手臂有多长、关节如何协同、当前姿态是否适合执行动作、失败后该如何调整。如果机器人不认识自己,再强的视觉语言模型也可能在执行阶段出现偏差。

爻方智能提出的双核架构,把 VLM、VGM 和 AGM 协同起来,并用逆运动学训练让机器人建立对自身运动边界的理解。零样本泛化成功率 89.6%、双臂协同超过 93% 的数据,说明“看懂场景”和“控制身体”正在被放进同一个问题里解决。具身智能下一步不是给机器人接一个会聊天的大脑,而是让它形成从感知、理解、规划到身体执行的闭环。

开源底座让机器人可调度

PhyAgentOS 的开源,则把行业视角从单个模型拉到系统层。物理智能模型和异构机器人很难靠一个模型解决所有问题,不同机器人有不同传感器、执行器、动作空间和任务限制。一个真正可用的机器人系统,需要管理任务会话、调度模型、适配本体、记录状态,并在复杂任务中保持上下文连续。

这也是 PhyAgentOS 以 Session 为核心的原因。它让任务不再只是一次模型输出,而是变成可管理的执行过程。公开测试中,LIBERO 基准成功率提升至 97-99%,CALVIN 长时序任务也明显改善,说明系统工程对具身智能同样关键。未来企业部署机器人时,可能不会只采购单个机械臂或单个模型,而会更关心底层系统能不能统一接入多种设备、能不能追踪任务状态、能不能让机器人可靠复盘和继续执行。

从榜单走向现场

同一批资讯里还有影眸科技的 cuNRTO 入围 RSS 最佳论文提名、国防科大 AirZoo 构建航拍几何 3D 视觉基准、超维动力发布高自由度人形机器人 KAIBot、高德推出具身技术体系 ABot。这些消息覆盖了轨迹优化、三维视觉、机器人硬件和导航决策,说明具身智能的竞争范围已经很宽,不再只是“机器人接入大模型”这么简单。

值得注意的是,越来越多团队开始强调评测、数据、系统和硬件协同。机器人要在真实世界工作,必须面对光照变化、遮挡、物体差异、空间误差、执行器磨损和突发干扰。榜单成绩能证明方向,现场稳定性才能证明价值。谁能把模型泛化、低延迟推理、硬件控制、安全约束和任务管理一起做好,谁才更有机会把具身智能从展台带到生产线。

商业化要看可靠交付

具身智能热度升高,也会带来商业化压力。公司融资、开源模型、发布机器人原型都能吸引注意,但客户最终买单的往往不是“最酷的演示”,而是“能否减少人工、提高良率、稳定运行、出了问题能否维护”。工业、物流、巡检、医疗康复和家庭服务对机器人要求不同,但共同点是不能只靠一次成功的视频说服市场。

这也是这轮机器人新闻真正值得关注的地方:行业正在把注意力从“让机器人动起来”转向“让机器人长期干活”。轻量 VLA 模型解决部署成本,灵巧手系统解决操作泛化,本体认知解决身体控制,开源 OS 解决调度与复用,轨迹优化和 3D 基准解决真实环境里的可靠性。具身智能还没有到大规模普及的终点,但它正在补齐从实验室走向现场所必须的工程链条。

© 版权声明
THE END
喜欢就支持一下吧
点赞5 分享