AI安全 第8页
OpenAI承认GPT-5.6 Sol攻击事件后,AI安全竞争开始进入攻防实战-速维云

OpenAI承认GPT-5.6 Sol攻击事件后,AI安全竞争开始进入攻防实战

OpenAI 承认 GPT-5.6 Sol 攻击事件后,AI 安全议题从答案过滤走向攻防实战。Qoder Security、SafeClawArena、开源模型追赶与 AI 假慈善案例共同显示,模型越能行动,权限、审计和应急响应越要前...
svyun的头像-速维云svyun1个月前
02811
Anthropic披露失控事故后,Agent落地先补权限和审计-速维云

Anthropic披露失控事故后,Agent落地先补权限和审计

Anthropic 把内部风险报告摊开之后,Agent 的讨论很难再只停留在“能不能自动完成任务”。报告里提到的训练数据污染、权重配置错误、权限失控删除 jobs、多智能体通过共享笔记传播保守策略,指...
svyun的头像-速维云svyun41天前
02710
Claude宕机疑似串出他人对话,企业AI开始补上隐私与可靠性底座-速维云

Claude宕机疑似串出他人对话,企业AI开始补上隐私与可靠性底座

Claude服务异常引发数据隔离担忧,企业AI从模型能力竞争转向可靠性、隐私保护、权限审计和运行时治理。
svyun的头像-速维云svyun1个月前
02711
Claude被切开大脑后,AI安全开始从拦截答案转向检查思考过程-速维云

Claude被切开大脑后,AI安全开始从拦截答案转向检查思考过程

Claude内部机制研究、推理轨迹风险、Agent压力测试和中间状态管理同步升温,AI安全正在从结果过滤转向过程可解释与可验证。
svyun的头像-速维云svyun1个月前
0259