Uber把超过七成代码变更交给Agent处理后,企业AI的竞争标准又变了。真正值得注意的不是“公司用了多少个智能体”,而是它把代码审查、研发协作和成本控制放进了同一套软件工厂:每天执行数万次任务,用户增长数倍,AI支出却没有同步膨胀。模型能力仍是基础,但能否把任务拆开、让工具稳定运行、把上下文组织好,并用账单证明效率,正在成为企业采购AI时更硬的指标。
软件工厂开始自动运转
Uber公开的内部实践显示,公司已经构建超过3600个AI Agent技能,每天执行超过3万次任务,覆盖代码审查等研发环节,约七成PR由Agent参与处理。这里的关键不是用一个万能模型替代工程师,而是把需求分析、代码检查、测试建议、文档维护等工作拆成边界清楚的能力,再让不同智能体在流程中各司其职。
这种做法与传统脚本自动化有明显区别。脚本只能按照预设步骤重复执行,Agent则能读取代码上下文,根据测试结果改变下一步动作,并在遇到不确定信息时提出问题。前提是每项能力都要有输入格式、输出标准、权限范围和失败处理,否则“智能协作”很快就会变成大量不可追踪的自动调用。
上下文图谱比堆模型更重要
Uber还构建了包含约2400万个节点的企业级上下文图谱,用来减少智能体无效搜索。大型组织里的代码仓库、服务依赖、负责人、历史变更、工单和发布规则往往分散在不同系统中,Agent如果每次都从头翻找,不仅速度慢,也容易把旧接口、过期文档或无关项目当成依据。
上下文图谱的价值,是把“这个文件为什么这样写”变成可以被检索和验证的关系网络。它不只是知识库的另一种名称,还应记录来源、更新时间、权限和可信程度。企业在建设这类系统时,先整理高频任务和关键链路,通常比盲目导入全部历史数据更有效;过期信息越多,模型越可能在看似完整的上下文里走错方向。

AI账单要按任务计算
这次实践最有启发性的数字,是请求量增长约9.4倍、周活跃用户增长约7倍,但AI总支出保持平稳。Uber通过模型路由、Token缓存和调用策略优化,把每千次请求成本降低34%,单会话成本降低52%。这说明低价模型并不是唯一答案,少犯错误、少重复读取、少走无效工具链,同样会直接改变最终账单。
企业核算AI成本时,不能只盯着每百万Token报价。一个模型如果经常生成错误代码,工程师需要反复修改;如果每次调用都携带整份项目上下文,输入费用会迅速累积;如果Agent无法判断何时停止,还会出现循环调用。更合理的指标是“完成一项任务花多少钱”,同时观察成功率、人工接管次数、延迟、回滚比例和后续维护成本。
路由和缓存成为基础能力
在研发流程里,不同任务需要的模型能力并不一样。格式检查、简单摘要、重复代码识别可以交给轻量模型;跨服务排查、复杂重构和高风险发布则需要更强的推理能力。按任务难度动态路由,能避免所有请求都挤向最昂贵的模型,也能让高价值调用获得足够的上下文和计算预算。
缓存同样不能理解成简单地保存回答。更值得缓存的是稳定的项目结构、依赖关系、工具说明和已经验证过的中间结果。缓存必须带版本号和失效条件,代码分支、接口协议或权限变化后要及时刷新,否则节省下来的Token可能换来更昂贵的错误。对承载企业Agent的云环境来说,CPU、内存、磁盘IO、网络延迟和日志留存也应纳入整体成本模型,像速维云这类云服务器服务,选型时要结合并发压测和故障恢复,而不是只看单项配置。
从代码审查走向业务执行
软件研发只是企业Agent最容易验证的起点。代码有明确的提交记录、测试结果和构建流程,适合建立反馈闭环;当这套方法成熟后,采购、客服、数据分析、财务对账和运维排障也可以采用类似结构:把任务拆成能力,让系统读取受控数据,执行可回滚动作,再由人审核关键结果。
但研发流程的成功不能直接证明Agent可以无条件接管业务。代码审查出错通常还能回滚,付款、删除数据、修改生产配置和向客户发信却可能造成即时损失。企业应按风险分级授权,低风险动作可以自动完成,高风险动作必须展示对象、范围、差异和预计影响,并保留人工确认、暂停和撤销入口。
安全要嵌进软件工厂
智能体数量增加后,安全不能靠最后一道人工检查。每个Agent都应拥有独立身份和最小权限,工具调用要记录任务目标、模型版本、输入来源、参数、返回结果与审批关系。对于第三方技能,还要固定版本、检查依赖、限制网络出口,把运行目录与源码、密钥和生产数据隔离。
企业还需要持续测试提示注入、恶意代码、越权读取、循环调用和错误路由等情况。防守侧Agent可以帮助归并日志、分析异常和生成修复建议,但不应直接把模型判断当成事实。只有经过规则引擎、沙箱或工程师验证后,隔离主机、撤销凭据等动作才适合自动触发。
企业要买的是可交付结果
Uber的案例把企业AI从“部署了多少模型”拉回了一个更务实的问题:每周到底完成了多少真实工作。Dify把Agent从应用节点提升为可独立构建、调试和发布的实体,行业也在尝试让技能跨场景复用;这些变化都说明,未来的企业AI不会只卖一个聊天界面,而会卖一套可以接入组织、持续运行并接受审计的执行系统。
对准备落地AI的团队来说,第一步不是追逐最多的Agent,而是挑选一个边界清晰、结果可验证、失败可回滚的任务,建立成本和质量基线,再逐步扩展到更多流程。模型升级会带来能力提升,但真正决定长期回报的,是上下文是否可靠、路由是否合理、权限是否克制、日志是否完整,以及系统能否在现实故障中停下来。AI软件工厂的终点,不是让机器显得忙碌,而是让每一项自动化都能被解释、被计价、被验收。





