缓存命中率刷屏后,Agent竞争开始拼执行底座和治理能力

开源编程 Agent「Pi」把 DeepSeek 的输入 Token 缓存命中率打到 99.93%,这条消息真正刺到行业神经的地方,不是 GitHub Star 数有多高,而是它把 Agent 产品一直绕不开的成本问题摊开了:当一个智能体要反复读项目、看日志、改文件、执行命令、回看结果时,模型费用往往不是按“问一次答一次”线性增长,而是被不断膨胀的上下文和重复工具信息拖着走。

Pi 的做法很克制,默认只提供四个基础工具,尽量减少会话里的冗余内容,让模型跳过已经处理过的部分,直接复用缓存计算。它说明 Agent 竞争正在从“模型会不会写代码”走向“执行系统能不能长期、便宜、稳定地跑任务”。同一天里,Anthropic 给 Claude 上线文本隐形水印,智谱披露 API 用户接近 700 万并启用超过 5 万块国产算力芯片,Runta 拿到 2000 万美元种子轮做智能体执行底座,几条新闻合在一起看,AI 产业的关键词正在变成成本、治理、算力和基础设施。

成本成为主战场

Agent 和普通聊天机器人的最大差别,是它需要在任务里不断循环。一次代码修复可能要读取多个文件、检索历史记录、执行测试、分析报错、再修改、再测试;一次企业自动化任务可能要跨知识库、工单、表格、邮件和内部系统。每一步都可能把上下文越堆越厚,模型能力越强,用户越愿意交给它长任务,成本失控的概率也越高。

Pi 把工具数量压到极简,本质上是在减少智能体运行时的“噪音面积”。很多 Agent 产品为了显得能力全面,会把大量工具说明、权限边界、调用格式和历史结果塞进上下文,短任务看不出问题,长任务就会变成巨大的输入账单。缓存命中率能接近满格,意味着系统设计已经开始主动迎合模型推理和计费机制,而不是把所有压力都丢给更大的模型。

这也解释了为什么 DeepSeek 这样的高性价比模型会在 Harness 和 Agent 场景里持续被关注。低模型单价只是第一层优势,真正能把总账压下来的,是模型、工具、缓存、路由、上下文裁剪和执行状态管理一起配合。一个模型每百万 Token 便宜,不代表整个 Agent 便宜;只有当系统能少传、少重复、少走弯路,成本优势才会在生产环境里兑现。

执行底座上桌

Runta 创始人戴冠兰提出“模型能力已经够了,要卷就卷 infra”,这句话和 Pi 的走红放在一起,指向同一个判断:下一阶段的智能体产品,不能只靠更强模型撑门面,而要有可靠的执行底座。这个底座要处理隔离环境、权限控制、审计记录、弹性扩展、失败恢复和资源计费,让 Agent 不只是会说计划,还能在可控范围内完成任务。

企业客户最在意的也正是这些环节。一个 Agent 如果能写脚本,却不知道哪些命令危险;能改配置,却没有审计留痕;能并行执行,却无法隔离租户和数据;能跑完演示,却在真实任务里把费用烧穿,那它就很难进入正式流程。Runta 获得 a16z 领投、Jeff Dean 和李飞飞参投,说明资本也在押注“智能体运行环境”会成为新基础设施层。

AI Agent infrastructure with servers and code
Agent 执行底座正在把模型调用、工具运行和算力资源重新组织到一起。

从开发者角度看,这类 infra 会把 Agent 从单机工具推向可运营服务。过去开发者更关心提示词、模型选择和工具调用,现在还要关心任务队列、沙箱、日志、权限、成本上限和异常回滚。谁能把这些复杂度压成稳定接口,谁就可能成为下一批 AI 应用的底层供应商。

治理压力同步上升

Anthropic 给 Claude 文本输出加入隐形水印,则把另一条线推到了台前:当 AI 内容规模越来越大,平台和企业需要更细的追踪能力。水印通过 Token 选择引入统计偏置,理论上可以帮助识别某段文本是否来自 Claude 输出,并配合文件里的 C2PA 签名做来源标记。这是主流模型厂商第一次把文本水印大规模推到产品层。

但 Anthropic 自己也承认,水印不能证明原创性,也可能受到质量影响、转写改写、元数据剥离等问题限制。它更像是一种治理基础设施,而不是万能鉴定工具。对企业来说,水印至少提供了一个追踪和合规抓手;对创作者和普通用户来说,它也会带来新的疑问:哪些内容会被标记,标记会不会影响隐私,改写后的文本还能不能被识别,平台会不会把水印当成处罚依据。

这条新闻和 Agent 执行成本并不割裂。智能体越多,自动生成的文档、代码、邮件、评论、报告和网页内容越多,内容来源就越难分辨。未来的 AI 系统可能需要同时具备两类能力:一边降低执行成本,让任务跑得更久;一边留下来源线索,让结果能被追踪、审计和问责。便宜而不可控的 Agent,对企业来说并不是真正可用的 Agent。

国产算力接住需求

智谱披露 MaaS 平台 API 用户接近 700 万,并启用超过 5 万块国产算力芯片,这条消息的重点不只是用户增长,而是国内模型服务正在把开发者需求、国产芯片和商业收入连成一条链。GLM-5 发布后 ARR 短期翻倍,说明模型能力升级仍然能带来商业转化,但背后真正决定能否持续的,是算力供给和服务稳定性。

当 Agent 成为高频调用入口后,算力需求会比普通聊天更陡。一个用户发起一次任务,后台可能拆成几十次模型调用;一个企业接入智能体流程,可能每天触发成千上万次检索、判断、生成和验证。国产算力芯片如果能在这类场景里承担稳定推理,就不只是替代进口硬件,而是在为国内 AI 应用建立更可控的成本和供应链基础。

这对企业选型也有现实意义。过去很多团队只比较模型榜单分数,现在还要看平台是否有足够算力、是否能支撑峰值、价格是否稳定、数据是否符合本地合规要求、API 是否容易接入内部系统。模型服务商如果没有算力和工程能力兜底,很容易在用户增长后被成本和稳定性反噬。

应用走向硬场景

谷歌 DeepMind 开源 WeatherNext Cyclones,也说明 AI 正在进入更硬的实际应用。这个模型可以同时预测台风路径、强度和风圈范围,最长给出 15 天预测,并在平均意义上比现有业务模型提前约 27 小时达到相同准确度。天气预测不是展示页上的炫技能力,它直接关系到航运、能源、农业、城市防灾和保险风控。

这类应用对基础设施的要求更高。模型不仅要准确,还要可复现、可解释、可部署、可更新,并能和现有业务系统结合。相比聊天、写作和图片生成,台风预测一旦出错,影响可能波及公共安全和经济调度。因此,开源代码和权重很重要,它让科研机构、气象部门和企业有机会验证、改进和适配模型,而不是只能等待黑盒 API 给出结果。

把 WeatherNext Cyclones、Pi、Claude 水印、智谱算力和 Runta 放在一起看,AI 产业正在从“能力演示期”进入“系统运营期”。模型仍然重要,但行业越来越关心模型之外的东西:调用成本能不能压住,执行环境能不能隔离,内容来源能不能追踪,算力供应能不能稳定,实际场景能不能承担风险。

下一轮比拼更工程化

这些重点新闻最清楚的信号,是 AI 竞争正在变得更工程化。Pi 的缓存命中率让大家看到,极简工具和上下文管理可以直接影响账单;Anthropic 的隐形水印说明,模型厂商开始把内容治理塞进底层输出机制;智谱的国产算力扩容证明,平台规模增长必须靠硬件供给承接;Runta 的融资则表明,Agent 执行底座已经从内部工程问题变成独立赛道。

对开发者来说,接下来做 AI 产品不能只问“哪个模型最强”,还要问“这套系统跑一百次、一万次、一个月后会怎样”。对企业来说,AI 采购也不能只看演示效果,而要把权限、审计、成本、稳定性、数据边界和灾备一起纳入评估。真正能落地的 AI,不一定是最会聊天的那个,而是能在复杂流程里稳定完成任务、把账单控制住、把风险留痕清楚的那套系统。

这也是 Agent 产品从热闹走向成熟必须经历的一步。模型能力继续向前,应用场景继续扩张,但最终决定谁能留下来的,往往是那些看起来不够性感的工程细节:缓存、路由、沙箱、日志、芯片、网络、审计和成本上限。AI 下一阶段的主角,可能不再只是模型名字,而是支撑模型长期工作的整套基础设施。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享