OpenAI 用 AI 攻击自家 AI:GPT-Red 自动发现安全漏洞,成功率 84% 远超人类
OpenAI训练内部AI模型GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,测试成功率达84%,远超人类红队的13%。其发现直接用于训练,使新模型在直接注入上的故障次数减少六倍,但仍有3.8%的强注入成功,且GPT-Red暂不对外开放。
原贴
查看原文原文
中文翻译
OpenAI 训练了内部 AI 模型 GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,在测试场景中成功率达 84%,而人类红队仅为 13%。GPT-Red 的发现直接用于训练,使 GPT-5.6 Sol 在直接提示词注入上的故障次数比四个月前的最佳模型减少六倍,且未影响通用性能。约 3.8% 的"更强"提示词注入仍能成功,GPT-Red 暂不对外开放。
核心信息
OpenAI训练内部AI模型GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,测试成功率达84%,远超人类红队的13%。其发现直接用于训练,使新模型在直接注入上的故障次数减少六倍,但仍有3.8%的强注入成功,且GPT-Red暂不对外开放。
- OpenAI训练内部AI模型GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,测试成功率达84%,远超人类红队的13%。其发现直接用于训练,使新模型在直接注入上的故障次数减少六倍,但仍有3.8%的强注入成功,且GPT-Red暂不对外开放。
- 原贴提到:OpenAI 训练了内部 AI 模型 GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,在测试场景中成功率达 84%,而人类红队仅为
- 来源:the-decoder.com
详细解读
这是什么信号:OpenAI 利用自我对弈强化学习训练专用红队模型 GPT-Red,实现了自动化、高精度的漏洞挖掘,标志着 AI 安全测试从人工主导转向 AI 驱动。这不仅提升效率,更揭示了“以攻促防”的闭环方法论。
为什么重要:当前大模型安全威胁(如提示词注入)日益严峻,传统红队成本高、覆盖有限。GPT-Red 将成功率从13%提升至84%,并直接反馈至模型训练,使新模型故障减少6倍,证明自动化红队是提升安全性的可扩展路径。但3.8%的残留风险提醒我们,完全防御尚不可能。
对谁有价值:AI 安全工程师、模型训练团队、负责合规与风险管理的决策者,以及依赖大模型的应用开发者。安全厂商也可借鉴此思路,构建自动化评估产品。
可以怎么行动:1) 研究 GPT-Red 使用的自我对弈强化学习方法,在自己的模型上实验;2) 建立持续自动化红队流程,集成到模型训练周期;3) 关注 OpenAI 后续是否开放类似工具,提前准备对接方案。
风险或限制:GPT-Red 暂未开放,技术细节有限。自我对弈可能产生对抗性过拟合,且存在攻击溢出风险(被滥用)。仍需人工专家审核自动化发现,特别是高风险的边缘案例。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《OpenAI 用 AI 攻击自家 AI:GPT-Red 自动发现安全漏洞,成功率 84% 远超人类》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。