智能体走出屏幕后,AI开始在家庭、实验室和企业里为结果负责

Figure AI把机器人送进30个陌生家庭做零样本测试,结果并没有呈现一场科幻电影式的完美首秀:整理床铺等任务在420次试验中成功237次,成功率从9%提高到56%。这个数字谈不上“机器人已经成熟”,却足以说明一件更重要的事:智能体正在离开熟悉的软件界面,开始接受陌生环境、连续动作和真实结果的检验。

AI科研实验室中的自动化生物实验与样本分析

同一天,AI又在另一端展示了类似趋势。Claude在四周内重写30多个生物分子模型,性能提升2至4倍;ScienceIDE把科学代码库变成可训练环境;Anthropic甚至设立湿实验室,让AI系统参与实体生物学研究。模型竞争的重点,正在从“能不能生成一段漂亮答案”转向“能不能把任务做完,并对过程和结果负责”。

从演示走进陌生环境

Figure AI发布的Helix 2.5测试,最有价值的地方不是成功率本身,而是测试条件。机器人面对的是30个此前没有采集数据的家庭,不依赖针对某个房间、某张床或某件物品提前训练的动作脚本,而是要在陌生空间中识别目标、规划动作、处理变化,再把任务推进下去。

56%的成功率仍然意味着大量失败,但它和9%的初始结果之间存在明显差距。更重要的是,这类测试把具身智能的评价从实验室中的标准物体、固定光线和预设轨迹,拉到了真实家庭的杂乱环境。家具位置、床品材质、遮挡关系和空间尺度都可能变化,机器人必须处理这些不确定性,才有资格谈服务价值。

Figure计划在未来12个月投入超过10亿美元扩展数据和训练规模,并为Index数据集支付1500万美元。这个动作反映出具身智能的核心难题仍然是数据与反馈,而不是发布一个更响亮的模型名称。机器人需要持续看到失败发生在哪里,知道哪些动作会导致物体滑落、碰撞或卡住,再把经验转化为下一次决策的改进。

科学代码成为新训练场

Anthropic披露,Claude在四周内优化了30多个开源生物分子模型,性能提升达到2至4倍。这里的关键并不是AI写了多少代码,而是它开始处理真正依赖算法、硬件和实验设定的科学工程问题:如何理解已有实现,定位瓶颈,改写代码,并通过评测确认优化没有破坏结果。

ScienceIDE的出现则把这类工作进一步系统化。该开源项目将科学代码库转化为包含64个环境、2812个任务的学习场景,让模型不仅生成代码,还能在相对明确的目标、资源和评价标准下反复尝试。最强模型在评测中仍只有67.1%的成绩,说明科学代码并非“让模型多写几次”就能解决,硬件利用率、数值稳定性和实验可复现性都会成为实际门槛。

这对企业使用AI也有直接启发。能够生成代码只是起点,真正有价值的系统必须把代码放入可运行环境,提供数据、工具、评测和回滚机制。没有这些配套,模型的“聪明”无法被稳定复现;有了这些配套,模型才可能从一次性助手变成能够持续积累经验的执行成员。

Agent进入公司要算结果账

NeoCognition发布的ApprenticeBench,把AI Agent放进模拟建筑公司担任会计。Fable 5.1的任务通过率达到72%,超过测试中的人类最高51%,但每张账单平均成本为18.23美元,而人类处理成本是7.21美元。这个结果很容易被“超过人类”吸引,却更应该先问:企业愿不愿意为这样的自动化支付两倍以上的成本。

Agent进入企业后,评价标准自然会改变。一个系统如果只是偶尔答对复杂问题,不能说明它适合长期生产;它还必须稳定处理异常、遵循权限、留下审计记录,并且在单位任务成本、响应时间和返工率上优于现有流程。企业不会只为模型的峰值能力买单,而会为可预测的交付结果买单。

值得注意的是,该评测显示最强模型的计算机使用成本已经基本消失,Agent可以直接操作企业现有软件。软件适配不再是唯一障碍,成本结构和责任边界反而更突出。未来的采购决策可能不再是“选哪个模型”,而是比较每个Agent完成一项完整业务任务需要多少调用、多少人工复核,以及出了错由谁处理。

生物实验室打开另一扇门

Anthropic设立湿实验室,探索让Claude等AI系统参与实体生物学研究,并将罕见病治疗和“不可成药”疾病作为方向。这意味着AI科研不再只停留在文献检索、实验方案建议或代码生成,而是尝试接入真实实验环境,让模型提出假设、安排步骤、读取反馈,再据此调整下一轮行动。

这条路线的难度远高于普通办公Agent。实验结果可能受到试剂批次、设备状态、温度和操作细节影响,模型必须区分偶然噪声与真正信号;同时,任何自动化实验都需要严格的权限分级、风险评估和人工确认。AI可以扩大实验搜索空间,但不能因为生成速度更快,就跳过生物安全和结果复核。

Anthropic收购Coefficient Bio并向多家药企提供AI服务,说明模型公司正在试图把能力延伸到行业数据和实体流程。不过,实验室并不是一个更大的聊天窗口。真正的竞争将发生在数据闭环、自动化设备、专业人员协作和可重复验证之间,谁能把这些环节连接起来,谁才可能把“AI科学家”从宣传语变成生产系统。

从能做事到能承担后果

把机器人入户、科学代码优化和企业会计评测放在一起看,会发现它们有一个共同变化:AI系统正在面对更长的任务链。模型不只需要理解指令,还要选择工具、保留状态、处理失败、重新规划,并在最后给出可以被人检查的结果。任务链越长,单次回答的准确率就越不足以代表整体可靠性。

因此,成熟的智能体系统至少要具备四类基础能力。第一是环境感知,知道自己面对的数据、设备和空间发生了什么;第二是过程记忆,能够保留关键状态而不是重复试错;第三是结果验证,使用测试、传感器、规则或人工复核确认输出;第四是权限和审计,明确它可以访问什么、修改什么,以及每一步为什么发生。

这也解释了为什么最新AI创业和研究开始同时涌向算力、机器人、科学工具与Agent运行时。模型能力仍然重要,但模型只是执行链的一部分。真正决定商业价值的,是系统能否把一次成功变成稳定复现,把一次失败变成可定位的反馈,把复杂任务变成企业愿意承担的成本。

AI走出屏幕之后,最值得观察的指标将不再是它能写出多像人的文字,而是它在陌生家庭里能否少摔一次东西,在实验室里能否让结果更可复现,在公司里能否用更低成本完成一项完整工作。智能体的下一场竞争,最终会落到一个朴素问题上:它到底能不能把事情做好。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容