OpenAI正在使用AI攻击自己的AI,效果比人类更好
OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。
原贴
查看原文原文
中文翻译
OpenAI训练了一个名为GPT-Red的内部AI模型,用于自动发现GPT模型的安全漏洞。GPT-Red模拟提示注入和其他攻击,这些攻击中恶意指令隐藏在电子邮件、网站或文件中。通过自对弈强化学习训练,GPT-Red发起攻击,防御模型进行拦截,两者随时间共同提升。它在84%的测试场景中成功发起攻击,而人类红队仅为13%。在一次测试中,它操控了OpenAI办公室内一台由AI驱动的自动售货机,修改了价格并取消了其他客户的订单。这些结果直接用于训练。OpenAI称,与四个月前的最佳模型相比,GPT-5.6 Sol在直接提示注入上的失败次数减少了六倍,且未影响整体性能。但大约3.8%的“更强”提示注入仍然成功。若扩展到数百或数千次尝试,相当数量的攻击会穿透,这与Claude Opus 4.5类似。GPT-Red保持内部;后续将发布一篇包含更多细节的论文。
核心信息
OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。
- OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。
- 原贴提到:OpenAI trained an internal AI model called GPT-Red to automatically find
- 来源:the-decoder.com
详细解读
这是什么信号
OpenAI正在用AI对抗AI安全漏洞,这表明自动化红队测试已成为前沿方向。GPT-Red通过自对弈强化学习实现自我进化,攻击成功率远超人类,标志着AI安全从人工主导转向机器主导。
为什么重要
传统红队依赖人类专家,成本高、效率低。GPT-Red在84%场景中找到漏洞,而人类仅13%,这意味着安全测试可以大规模、持续进行。直接结果用于训练,使得新模型对注入攻击的抵抗力显著提升(失败率降为原来的1/6),同时保持通用性能不下降。这为AI系统的安全性提供了一个可扩展的解决方案。
对谁有价值
1. AI安全团队:获得自动化、高覆盖率的漏洞发现工具,降低人力成本。2. AI模型开发者:可借鉴自对弈方法强化模型鲁棒性。3. 企业用户:使用基于GPT-5.6 Sol等新模型的产品时,安全性更高。4. 监管机构:自动化测试可作为合规评估手段。
可以怎么行动
1. 部署类似系统:在自己的AI产品中引入对抗训练流水线,持续生成攻击并更新防御。2. 关注论文细节:OpenAI将发布论文,可学习其算法设计并复现。3. 评估自身风险:对现有模型进行Prompt注入测试,尤其关注“更强”攻击场景(如复杂多轮注入)。4. 建立红队自动化:将GPT-Red的思路应用于其他安全领域,如越狱、隐私泄露等。
风险或限制
1. 仍有3.8%的强攻击成功:绝对数值虽小,但大规模调用时可能积累风险。2. 内部工具不公开:外界无法直接使用GPT-Red,只能依赖OpenAI的披露。3. 可能被恶意利用:类似技术若落入攻击者手中,可制造更狡猾的漏洞。4. 泛化性未知:是否适用于其他模型架构(如Claude、Gemini)尚未验证。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《OpenAI正在使用AI攻击自己的AI,效果比人类更好》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
OpenAI正在使用AI攻击自己的AI,效果比人类更好主要讲什么?
OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。
这篇文章最值得关注的要点是什么?
OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。;原贴提到:OpenAI trained an internal AI model called GPT-Red to automatically find;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI副业、AI工具、AI超级个体专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容命中「学习」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。