OpenAI把Codex里最关键的“执行外壳”单独拿出来,变成面向开发者的Agents API:用户只需要提供任务、模型、工具和运行环境,智能体就能在云端持续推进工作,Harness的维护、调度与执行由平台负责。这一步的信号比又发布一个模型更直接——AI产品正在从“给出答案”转向“接住任务”,竞争焦点也从单轮生成转向权限、环境、工具和结果交付。
同一批新动态还把这条主线推向了更多场景。数学家创立的清雁科技试图用几何物理表征降低世界模型的数据需求,京东与多家机器人企业把数据和反馈闭环摆到模型参数之前,蚂蚁则发布面向智能体交易的身份与授权基础设施。AI正在形成一套新的生产栈:模型负责理解和规划,工具负责专业执行,系统负责验证、追踪与承担责任。
执行层成为新入口
传统API通常把模型当作一次性函数:输入提示词,等待文本或结构化结果,再由开发者自行处理后续流程。Agents API改变的是责任边界。开发者可以声明智能体要完成的目标、允许使用的工具、运行时环境和资源限制,由平台托管任务循环,让模型在调用工具、读取反馈、修正计划之间连续工作。对企业来说,这比把聊天接口接入网页更接近真实业务。
但“能执行”不等于“可以放任执行”。一个合格的智能体系统必须明确哪些文件能读写、哪些命令需要审批、网络访问能到哪里、任务失败后能否回滚,以及每次调用留下什么证据。OpenAI把Codex的Harness能力产品化,实际上也把这些工程问题推到了台前:模型能力只是起点,隔离环境、日志审计、成本控制和异常终止,才决定它能不能进入生产环节。
世界模型不只靠堆数据
清雁科技由数学家创立并完成超亿元A轮融资,提出几何物理表征与验证体系,试图让模型学习物体背后的恒定结构,而不是记住大量外观变化。按照公司披露,其物理引擎计算效率达到主流引擎Newton的数倍,后续计划推出面向公众的模型。无论最终效果如何,这种路线都指出了世界模型的一条关键难题:如果每一种位置、材质和运动状态都要靠海量样本覆盖,训练成本与泛化能力始终会互相牵制。
物理先验的价值,在于把“看见过什么”与“世界应该怎样运行”区分开来。对于机器人、工业仿真和三维内容生成,模型不仅要识别一个物体,还要判断它能不能被抓起、碰撞后会怎样、改变视角后结构是否仍然一致。验证体系同样重要,因为世界模型一旦输出错误的空间关系,后果可能不是画面瑕疵,而是机械动作失败或生产方案不可用。
机器人竞争转向反馈闭环
在京东全球科技探索者大会上,智元、智平方、鹿明、逆矩阵等企业讨论机器人从演示走向真实世界的障碍。行业共识正在变化:难点不再只是让机器人完成某个漂亮动作,而是让它在不同物体、光线、地面和任务约束下持续可靠地工作。京东提出未来两年积累大量人体操作数据与真机操作数据,覆盖零售、物流、家政和工业等场景,说明真实反馈正在成为新的基础设施。
这也解释了为什么“模型跑分高”越来越不能单独说明机器人的商业价值。实验室里一次成功可以靠精心布置,仓库和家庭却会不断出现遮挡、磨损、临时物品和未见过的动作。机器人需要把感知、规划、控制、执行结果和失败原因记录下来,再把这些信息送回训练与评测流程。谁能建立低成本的数据回流和安全修正机制,谁才可能把Demo变成可持续交付的产品。
智能体开始拥有商业身份
当智能体从软件内部走向真实交易,另一个问题会立刻出现:它代表谁,又凭什么花钱?蚂蚁集团发布APASS智能体商业信任基础设施,围绕KYA理念建立身份链和意图链,提供身份核验、授权管理与责任追溯能力。系统已接入数百家服务商并激活大量Agent,目标是让智能体在获得明确授权后,能够替人完成购买、预约、支付和其他商业操作。
这类基础设施的重点不是给Agent发一张漂亮的数字名片,而是把“允许做什么”写成可以判断和回溯的规则。用户可以授权智能体查询价格,却不授权直接付款;企业可以允许它创建订单,却要求超过额度时由负责人确认。只有把身份、意图、额度、有效期和操作记录放在同一条链上,智能体的自主性才不会变成不可解释的越权行为。
从工具调用到组织协作
OpenAI的Agents API、企业级数字员工以及面向一人公司的多Agent协作产品,都在试图解决同一个效率瓶颈:很多工作并不难在某一步完成,难的是把找资料、沟通、执行、复核和交付连续串起来。CarryGo展示的企业初始化、跨企业项目管理与任务协调,就是让智能体参与找客户、谈条件和组织交付,在授权范围内推进试单,超出边界再交由负责人确认。
这种模式对中小团队尤其有吸引力,但也最容易被“全自动”三个字误导。真正可用的系统应当把任务拆成可观察的节点,给每个节点设置输入、输出和验收条件;涉及合同、付款、客户承诺或生产变更时,必须保留人工闸门。对部署团队而言,选择云端或自建环境时,还要评估网络隔离、密钥管理、并发配额和日志留存。需要稳定运行多类Agent的企业,可以了解速维云的云服务器与基础运维支持,把运行环境和业务监控一起纳入规划。
企业该怎样接住变化
第一步不是立刻采购最强模型,而是挑选一个边界清晰、结果容易验证的任务。例如自动整理工单、生成测试报告、核对资料或根据模板创建内部文档。先定义允许访问的数据范围、失败时的处理方式和人工确认节点,再比较不同模型在完成率、耗时、Token成本与返工率上的表现。
第二步是为智能体建立“可暂停、可解释、可恢复”的运行机制。所有工具调用都应记录调用者、参数、结果和权限来源;关键操作使用短期凭证与最小权限;长任务按阶段保存中间产物,避免一次失败就从头开始。未来的AI竞争不会只属于参数最多的模型,也会属于那些能让企业放心把任务交出去、又能在出错时迅速收回控制权的平台。






暂无评论内容