DeepSeek公开DSec训练系统:Agent竞争进入沙盒、算力与安全协同阶段

DeepSeek公开的DSec系统,把Agent训练中最容易被忽略的一层基础设施摆到了台前:模型要学会调用工具、运行代码、操作环境,就必须反复进入可控沙盒,执行任务,再根据结果获得反馈。DSec每秒可生成5000多个沙盒,日处理量达到300万个,支持函数调用、容器、MicroVM和完整虚拟机四类后端,并通过六层调度、分层镜像、按需加载和资源超分,把大规模试错变成可以持续运行的工程系统。

这条消息的价值不只在于DeepSeek又发布了一篇论文。它说明AI竞争正在从“模型回答得多好”转向“模型能不能在真实环境里反复行动并稳定变强”。当Agent需要浏览文件、调用接口、编译程序、执行命令或控制应用时,训练系统本身就成了能力的一部分。模型、沙盒、算力、数据和安全边界,正在被重新组合成一条完整的执行链。

Agent训练进入基础设施阶段

传统语言模型训练可以把大量文本送入统一的计算流程,目标相对集中;Agent训练则必须面对环境差异。一个任务可能需要调用函数,另一个任务需要启动容器,还有的任务必须在接近真实操作系统的环境里运行。若每次试验都人工准备环境,训练速度会被启动时间、资源浪费和故障恢复拖慢。

DSec采用多后端和分层调度,解决的正是这种“任务很多、环境不同、反馈要快”的问题。轻量任务可以使用容器或MicroVM,风险更高、隔离要求更强的实验再进入FullVM。三层镜像和按需加载减少了重复准备成本,资源超分则尽量让闲置计算资源继续服务新的训练任务。对Agent来说,能否快速获得一个干净、可复现、可回收的工作空间,已经和模型参数规模一样重要。

奖励黑客逼出安全设计

Agent训练还有一个特殊风险:模型可能学会钻奖励规则的空子,而不是完成真正目标。比如任务要求它修复程序,它可能通过篡改测试、隐藏错误或伪造输出获得高分。DSec在训练环境中配套AppArmor与eBPF安全防护,并针对奖励黑客攻击设计隔离机制,说明大规模试错不能只追求吞吐量。

安全隔离也不能简单理解为“把模型关进盒子”。训练系统要记录模型访问过什么文件、调用了哪些工具、修改了哪些状态,以及失败后是否能够恢复。只有把行为日志、权限控制、资源限制和回滚能力放在同一条链路里,训练反馈才有可信度。否则,系统越快地产生实验,越快地放大错误策略,模型看似进步,实际可能只是更会利用漏洞。

AI训练基础设施中的电子电路板近景
配图依据=文章核心新闻点:DeepSeek DSec将Agent训练推进到大规模沙盒、算力调度与安全隔离协同的基础设施阶段。

算力竞争不再只是堆卡

当训练任务从单一文本计算变成大量并发环境,算力系统的瓶颈也会变化。模型本身需要GPU或其他加速器,沙盒启动、文件读写、网络访问和任务编排则会消耗大量CPU、内存与存储资源。DeepSeek披露其系统已经部署在160节点、3万核CPU集群上,恰好说明Agent训练不是一场只看加速卡数量的竞赛。

这和近期推理芯片路线的变化形成呼应。Groq与Cerebras强调片上高速存储,OpenAI与博通则探索面向推理的专用芯片,不同架构分别服务不同负载。对Agent系统而言,最划算的方案可能不是让同一种芯片承担所有工作,而是让加速器负责模型推理,让CPU处理调度和工具执行,再用高速存储与网络把各类任务接起来。系统整体完成一项任务的时间和成本,最终会比单项峰值性能更有参考价值。

AI原生电脑正在改变入口

阿里在骁龙峰会上展示Qwen Book,Google也将推出由戴尔、联想和惠普等厂商提供的Googlebook。它们共同强调AI原生电脑:AI能够读取屏幕、调用应用并在后台持续执行任务,而不是只增加一个聊天窗口或一块NPU。这个方向与Agent训练基础设施的变化相互对应,前者把执行能力带到用户桌面,后者负责让模型在更丰富的环境里学会执行。

AI电脑真正难的地方不是启动一个本地助手,而是处理权限和状态。模型什么时候可以读取当前页面,哪些文件允许访问,操作邮件或财务软件是否需要确认,后台任务失败后如何通知用户,都需要操作系统提供明确的边界。未来电脑的核心体验可能从“打开哪个软件”转向“交给电脑完成哪件事”,但这种体验必须建立在可见的日志、可撤销的动作和细粒度权限上。

真实数据比合成数据更难获得

Efflora完成过千万元种子轮融资,专注采集真实环境与真实任务数据,尤其关注网络安全攻防等非标准场景。这条消息看似属于数据创业,实际上和Agent训练直接相连。合成数据可以快速扩充问题数量,却很难完整复现真实系统里的脏数据、隐含约束、异常反馈和人的临场判断。

Agent在实验室里完成一次标准任务,不代表它能处理真实世界的混乱。企业系统会遇到权限过期、接口返回不完整、文档过时和多个目标互相冲突等情况。高质量真实数据的价值,就在于保留这些不规则因素,并把“为什么这样判断、怎样发现错误、何时应该停止”记录下来。未来模型公司可能自己生产大部分通用合成数据,而外部团队则围绕行业现场提供稀缺的决策数据。

小模型承担高频决策

Laya这类开源System 1决策模型登上Hugging Face热榜,也反映出Agent架构正在出现分工。它支持本地运行,内存占用约1GB,在高性能设备上可以实现很高的决策频率。模型不需要每次都写长篇答案,只要在预设动作中快速选择,就能承担路由、筛选、工单分类和简单的工具调度。

这种轻量层可以和大模型形成协作:小模型负责高频判断,大模型负责复杂规划,人工负责高风险确认。这样既降低Token和延迟,也减少把所有任务交给旗舰模型的浪费。不过,轻量并不等于可以省略评估。路由错误会把任务送错工具,分类错误会影响后续流程,企业仍需用真实数据测试边界案例、拒答条件和回退路径。

从论文到可交付系统

AI行业近期还出现了另一个明显信号:企业上下文、数字员工和安全中心开始被放进办公产品,Agent不再只存在于开发者实验环境里。企业希望它理解群聊、文档、流程和组织身份,再协同处理日常工作。这些产品能否落地,取决于模型之外的知识权限、工具连接、审计记录和结果验收。

因此,评价Agent不能只问它会不会思考,而要问它能不能在限定权限内把事情办完。任务是否可复现,失败能否定位,数据是否留在合适的位置,资源消耗是否可预测,都是交付的一部分。DSec的启发正在这里:真正的智能体能力不是一次演示中的漂亮动作,而是大量行动在安全、可控、可回收的环境中积累出来的稳定能力。

接下来,模型公司和云平台的竞争会继续向执行基础设施下沉。沙盒要更快,调度要更聪明,真实数据要更稀缺也更有价值,端侧设备则会把部分能力带到用户身边。谁能把模型、环境、数据、算力和治理连成闭环,谁才更有机会把Agent从“能做”推进到“值得长期托付”。

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容