AI开始参与AI研发后,Deep Search竞争进入系统闭环时代

AI开始参与AI研发

XYZ Agentic Team 把 Deep Search 做到 SOTA 的消息,比单纯发布一个新模型更值得盯。它的特别之处不只是有 35B 和 397B 两款模型,也不只是多项测试拿到高分,而是整个研发过程本身已经被重新组织:14 名人类成员加上约 400 个 Agent Worker,在两个月里完成了一个 Deep Search 系统的搭建、诊断、优化与记录。AI 不再只是被训练出来的结果,而开始成为训练、评估和系统迭代的一部分。

这类 AI4AI 流程真正改变的是研发节奏。过去,一个搜索增强系统要从数据、模型、检索、规划、评估和前端体验多个环节反复调试,人类团队需要在大量日志和失败样例里手工找线索。现在,Research、Development、Review、Record 四步循环被 Agent 接管了一部分:Agent 负责提出假设、写实验、复盘失败、沉淀经验,人类则更像系统架构师和方向把关者。它不是把研究员替换掉,而是把研究员从重复试错里抬出来,让更多精力放在判断什么问题值得解。

Deep Search正在成为新战场

Deep Search 之所以重要,是因为它连接了大模型最被用户期待、也最容易翻车的能力:复杂问题检索、跨来源整合、长链路推理和可信引用。普通聊天模型可以凭语言流畅度给出一个看似完整的答案,但深度搜索系统必须回答“资料从哪里来”“哪些结论有冲突”“不同来源的可信度如何”“下一步应该查什么”。这要求模型不仅会生成,还要会拆题、会验证、会改错。

XYZ Agentic Team 的框架把这些环节做成闭环,意味着 Deep Search 不再只是“把搜索结果塞进上下文”。当 Agent 能够主动诊断系统短板,比如检索召回不足、摘要丢失关键信息、评测指标与真实用户问题不一致,系统迭代就会从一次次人工救火,变成持续改进的流水线。报道里提到 AI 主动提出人类没有想到的 active compact 方案,这个细节很关键:AI 的价值不只是加速执行,也开始在系统设计层提供新思路。

从模型竞赛转向研发组织竞赛

这条新闻和中国人民大学高瓴人工智能学院发布的长程智能体综述放在一起看,会更清楚:长程能力正在被重新定义为系统级能力,而不是单个模型的孤立指标。综述梳理了超过 900 项研究,强调“外部脚手架工程”和“内部模型优化”需要协同演化。也就是说,未来一个 AI 系统强不强,不能只看基座模型参数和榜单分数,还要看它有没有任务分解、状态管理、工具调用、错误恢复和经验沉淀机制。

这对 AI 公司很现实。过去大模型竞争经常围绕“谁的模型更大、谁的评测更高、谁的价格更低”展开,但 AI4AI 的出现说明,研发组织本身也会变成竞争壁垒。谁更早把 Agent 纳入内部研发流程,谁就可能用更短时间完成更多实验;谁能把实验失败写成可复用知识,谁就能减少下一轮重复踩坑。模型能力当然仍然重要,但围绕模型搭建的研发机器,正在变得同样重要。

AI agents working on Deep Search research workflow dashboards
AI研发正在从单点模型能力走向Agent协作、搜索验证与持续复盘的系统闭环。

编程Agent也在重做工具链

硅谷一场 Coding Demo Night 的报道,给了另一个侧面。多个团队展示了 coding agent 如何开始阅读代码、协作改造项目、记录会话资产,甚至有人用 Claude 独立完成 15000 行 LinkedIn 替代品。行业讨论的重点已经从“AI 能不能写代码”,转向“当 Agent 成为正式参与者后,协作方式和工具要怎么重做”。这和 Deep Search 的 AI4AI 逻辑是一致的:AI 不只是回答者,而是工作流里的执行者、记录者和复盘者。

开发工具因此会发生变化。传统 IDE 面向的是人类程序员,核心是文件、光标、补全、调试器;Agent 时代还需要任务状态、长期记忆、权限边界、变更解释、多人接管和失败回滚。Valkor 联合浙江大学、伦敦大学学院推出的 Loom,也正是为了解决 AI 编程长任务中的“局部失忆”。它把软件交付过程拆成可恢复的状态链,让 Agent 可以持续推进任务,也让其他 Agent 能低成本接手。工具链不重做,Agent 再聪明也会被长任务拖垮。

具身智能补上触觉,AI走向真实世界

AI4AI 之外,具身智能同样在补基础设施。新智具身联合复旦大学发布的 N0 系列技术报告,把超过 3 万小时触觉数据做成底座,并通过 N0-Foundation 统一触觉“方言”,再用 N0-VTLA 和 N0-TWAM 去增强视觉语言动作模型与世界模型。插插头成功率达到 85%、仿真成功率达到 84.5%,说明机器人正在从“看见物体”走向“理解接触”。

触觉的意义在于,真实世界的很多任务不是靠视觉就能完成。插头是否对齐、杯子是否打滑、布料是否被拉紧、零件是否卡住,这些都发生在手和物体接触的一瞬间。过去机器人 Demo 容易在实验室里成功,到了复杂环境就失败,原因往往不是模型不会规划,而是缺少对摩擦、力度、形变和微小误差的反馈。触觉数据如果成为开源基础设施,会让具身智能训练更接近真实部署,也会推动机器人从展示视频走向稳定工作。

AI应用开始融合内容与陪伴

应用层也在出现更轻、更娱乐化的变化。逗逗游戏伙伴和海外版 Hakko AI 全球注册用户突破千万后,团队又推出 Luddi 和 Cuddler:前者面向 AI 生成游戏,后者把聊天记录生成短视频、条漫、互动剧等内容。这个方向看似轻松,其实反映了一个重要趋势:AI 陪伴不再只停留在文字对话,而是在向可分享、可观看、可二创的内容形态延伸。

如果说早期 AI 角色产品的核心是“陪你聊天”,下一阶段可能是“把你们的互动变成故事”。用户不只是消费 AI 生成内容,也把自己的聊天、情绪和角色关系交给系统再创作。这会带来新的产品机会,也会带来新的边界问题:隐私如何处理,角色记忆归谁所有,生成短剧是否可能误导他人,未成年人和情感依赖该怎样保护。AI 应用越贴近娱乐和陪伴,越需要把体验设计、内容安全和用户控制权一起做好。

融资、传闻与安全边界仍在搅动行业

围绕 AI 的资本故事也没有降温。体育明星转型做 VC 的报道里,梅西投资李飞飞的 World Labs,C 罗入股 AI 搜索公司 Perplexity,说明 AI 公司正在借助全球影响力进入更广泛的大众视野。与此同时,DeepSeek 新一轮融资或暂停的消息,则提醒行业:融资、估值和信息披露已经成为大模型公司治理的一部分。闭门会议内容泄露引发创始人不满,不只是公关事件,也会影响投资节奏和内部信任。

安全与认知层面的讨论也在升温。Stephen Wolfram 把 AI 称为第一种“外星智能”,强调它拥有与人类不同、难以用语言完全解释的认知结构。这种说法虽然带有哲学意味,但放在模型越狱、系统提示词泄露、Agent 长程执行和 AI 自我优化的背景下,并不只是修辞。AI 系统越能自主发现漏洞、提出方案和执行任务,人类越需要建立可审计、可暂停、可解释的治理机制。真正成熟的 AI 不是看起来无所不能,而是在强能力旁边配上清楚的边界。

真正的竞争在闭环能力

把这些资讯放在一起,最清晰的主线是:AI 行业正在从“模型展示能力”转向“系统完成任务”。Deep Search 要靠 Agent 循环持续改进,Coding Agent 要靠状态链和协作工具跑长任务,具身智能要靠触觉数据补真实反馈,陪伴产品要把对话转成可消费内容,资本市场则要求公司把技术叙事落到治理、收入和信任上。每一个方向都不再满足于单点突破,而是在追求闭环。

这也会改变用户和企业选择 AI 产品的标准。未来大家不会只问“这个模型聪不聪明”,还会问:它能否追踪任务状态,能否解释资料来源,能否在失败后复盘,能否让人类接管,能否把一次经验沉淀到下一次任务里。AI4AI 的出现把这个趋势提前摆到了台前:当 AI 已经开始帮助研发 AI,竞争就不只是模型之间的竞争,而是整套研发、部署、审计和应用系统之间的竞争。

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容