系统提示词泄露之后,AI模型安全开始进入可验证阶段

一款前沿模型刚发布,系统提示词却在数小时后被完整摊开:Fable 5.1的发布与泄露几乎同时发生,让“模型会什么”与“模型不能做什么”第一次以同样刺眼的方式摆在公众面前。Anthropic公布的信息显示,Fable 5.1在ARC-AGI-2测试中达到90%,推理成本较前代降低32%,还曾用44分钟破解困扰密码学界370年的历史密码难题;随后,黑客Pliny the Liberator公开了超过27万字的系统提示词,其中包括核心行为逻辑、46个工具与安全限制。

这不是一次普通的提示词“彩蛋”。同一批资讯里,北航等机构把真实漏洞重建成训练任务,训练网络安全模型OpenAegis;上海交大等团队则用Agent参与工业Coding模型iCoder的数据、训练和奖励全链路。模型能力正在向安全研究、软件开发和科学发现延伸,安全边界也从一段藏在后台的文字,变成需要持续验证、记录和修正的运行系统。

提示词不再是秘密护城河

系统提示词通常负责规定模型的角色、工具调用方式、回答边界和异常处理策略。它当然不是模型全部能力的源代码,但27万字内容仍可能暴露产品如何组织任务、何时调用工具、怎样处理冲突,以及哪些限制依赖文字规则而不是更深层的技术隔离。对研究者来说,这是观察模型产品化结构的窗口;对攻击者来说,则可能成为寻找薄弱环节的索引。

Fable 5.1事件更值得注意的地方,在于它把模型评测与安全评测拉到了同一个现场。ARC-AGI-2达到90%、密码学难题在44分钟内被破解,说明系统拥有很强的推理和搜索能力;但能力越强,系统提示词、工具权限和外部环境之间的关系就越复杂。开发者不能只问模型能否答对,还要追问它在获得工具后会不会越权、面对诱导时能否守住边界,以及发生异常后能否留下完整证据。

安全边界要从文字走向隔离

如果安全限制主要写在提示词里,泄露后固然会增加对抗风险,但真正的问题并不只是“别人看到了规则”。更重要的是,系统是否把高风险动作交给独立的权限层、沙箱和人工确认环节。模型可以提出删除文件、修改配置或调用外部服务的建议,却不应该仅凭一段自然语言就获得不可逆操作的最终授权。

网络安全模型OpenAegis的训练思路提供了另一个方向。CyberFactory框架把真实漏洞重建为可训练任务,并生成智能体轨迹;在1小时限时评测中,OpenAegis通过率达到58.1%,较Qwen3.5基座提升28.5个百分点。这个结果的价值不在于一个分数就能证明安全,而在于它把“会不会发现漏洞”变成可重复的任务、过程和验证结果,安全能力因此有机会进入模型迭代环节。

AI模型安全审计与数字防护电路示意图
AI模型安全审计与数字防护基础设施示意图(图片:Pexels)

AI正在参与下一代AI研发

上海交大等联合团队用AI Agent主导开发27B工业Coding模型iCoder,覆盖数据、训练和奖励全链路。测试显示,RTLLM从49.6提升至68.0,KernelBench正确任务达到原来的2.64倍,EDA循环平均cell reduction达到51.1%。更有意思的是,验证器漏洞和数据偏差并非被简单掩盖,而是由Agent诊断并修正,模型能力最终被写入参数,而不是只留在外部脚本里。

这意味着AI参与AI研发,已经不只是让模型帮忙写几段代码。它开始接触数据筛选、实验设计、评测标准和错误分析,而这些环节决定了下一代模型究竟学到什么。效率提升很有吸引力,但风险也会同步放大:如果训练数据存在偏差,验证器本身又有漏洞,Agent可能把错误快速复制到更大规模的系统中。因此,自动化研发必须把独立评测、可追溯日志和人为复核放在流程核心。

世界模型把安全带到现实空间

李飞飞的World Labs发布全球首个多模态世界模型Atlas,模型能够像素级控制相机生成图像和视频,同时进行三维重建,并理解空间与时间。Atlas支持文本生成图片、360度全景图和机器人Real-to-Sim模拟,只需几张照片就能生成逼真的RGB与深度数据,目前已开放早期访问。

世界模型的意义不止是生成更漂亮的画面。它一旦用于机器人训练、仿真测试或复杂环境预测,模型输出就可能影响真实设备的动作选择。安全评测也必须从文字回答扩展到空间关系、连续状态和行动后果:物体是否保持一致,视角变化是否导致误判,模拟环境里的成功率能否迁移到现实,都需要单独验收。生成内容与执行动作之间,应该保留清晰的闸门。

企业落地先问能否复核

近期的模型更新共同说明,AI正从单轮对话进入更长的任务链。企业部署时,最先要建立的不是“让模型权限最大化”,而是把任务拆成可观察的步骤:输入从哪里来,调用了什么工具,产生了哪些中间结果,哪些动作需要审批,失败后如何回滚。系统提示词可以帮助模型理解规则,但不能替代身份认证、网络隔离和数据访问控制。

对于需要运行模型、保存日志和承载业务工具的团队,基础设施的稳定性同样会影响安全判断。无论使用自建环境还是速维云等云端资源,都应按最小权限配置访问范围,分开训练、测试与生产数据,并为敏感操作设置审计链路。云资源不是安全的自动答案,但稳定的计算、存储和网络隔离,能让安全策略真正落到可执行的环境里。

从泄露事件得到的三条经验

第一,系统提示词应被当作需要保护的配置资产,但不能把全部安全性寄托在“没人看见”。第二,工具调用必须采用分级授权,让模型的建议、用户的确认和系统的执行彼此分离。第三,模型上线前后的评测不能只做能力榜单,还要覆盖越权、诱导、数据外泄、漏洞发现和失败恢复等真实任务。

Fable 5.1的提示词泄露让安全规则变得可见,OpenAegis和iCoder则展示了把安全与研发纳入可验证流程的可能性,Atlas进一步提醒行业:当模型开始理解并生成现实空间,错误的代价也会从一段不准确的文字变成一次错误动作。下一阶段的竞争,不只是更强的模型,而是谁能把能力、权限、环境和证据组织成一个经得起检查的系统。

© 版权声明
THE END
喜欢就支持一下吧
点赞5 分享