觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-07-16 4 浏览 免费阅读

OpenAI正在使用AI攻击自己的AI,效果比人类更好

OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-07-16 03:47:53

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

OpenAI trained an internal AI model called GPT-Red to automatically find security flaws in GPT models. GPT-Red simulates prompt injections and other attacks where malicious instructions hide in emails, websites, or files. Trained via self-play reinforcement learning, GPT-Red attacks while defender models block, and both improve over time. It finds successful attacks in 84 percent of test scenarios versus 13 percent for human red teamers. In one test, it manipulated an AI-powered vending machine in OpenAI's office, changed prices, and canceled other customers' orders. The results feed directly into training. GPT-5.6 Sol shows six times fewer failures on direct prompt injections than the best model from four months ago, OpenAI says, without hurting general performance. But about 3.8 percent of "stronger" prompt injections still succeed. Scale that to hundreds or thousands of attempts, and a sizable number get through, similar to Claude Opus 4.5 . GPT-Red stays internal; a paper with more details will follow. Ad DEC_D_Incontent-1 Ad Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

中文翻译

OpenAI训练了一个名为GPT-Red的内部AI模型,用于自动发现GPT模型的安全漏洞。GPT-Red模拟提示注入和其他攻击,这些攻击中恶意指令隐藏在电子邮件、网站或文件中。通过自对弈强化学习训练,GPT-Red发起攻击,防御模型进行拦截,两者随时间共同提升。它在84%的测试场景中成功发起攻击,而人类红队仅为13%。在一次测试中,它操控了OpenAI办公室内一台由AI驱动的自动售货机,修改了价格并取消了其他客户的订单。这些结果直接用于训练。OpenAI称,与四个月前的最佳模型相比,GPT-5.6 Sol在直接提示注入上的失败次数减少了六倍,且未影响整体性能。但大约3.8%的“更强”提示注入仍然成功。若扩展到数百或数千次尝试,相当数量的攻击会穿透,这与Claude Opus 4.5类似。GPT-Red保持内部;后续将发布一篇包含更多细节的论文。

核心信息

OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。

  • OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。
  • 原贴提到:OpenAI trained an internal AI model called GPT-Red to automatically find
  • 来源:the-decoder.com

详细解读

这是什么信号

OpenAI正在用AI对抗AI安全漏洞,这表明自动化红队测试已成为前沿方向。GPT-Red通过自对弈强化学习实现自我进化,攻击成功率远超人类,标志着AI安全从人工主导转向机器主导。

为什么重要

传统红队依赖人类专家,成本高、效率低。GPT-Red在84%场景中找到漏洞,而人类仅13%,这意味着安全测试可以大规模、持续进行。直接结果用于训练,使得新模型对注入攻击的抵抗力显著提升(失败率降为原来的1/6),同时保持通用性能不下降。这为AI系统的安全性提供了一个可扩展的解决方案。

对谁有价值

1. AI安全团队:获得自动化、高覆盖率的漏洞发现工具,降低人力成本。2. AI模型开发者:可借鉴自对弈方法强化模型鲁棒性。3. 企业用户:使用基于GPT-5.6 Sol等新模型的产品时,安全性更高。4. 监管机构:自动化测试可作为合规评估手段。

可以怎么行动

1. 部署类似系统:在自己的AI产品中引入对抗训练流水线,持续生成攻击并更新防御。2. 关注论文细节:OpenAI将发布论文,可学习其算法设计并复现。3. 评估自身风险:对现有模型进行Prompt注入测试,尤其关注“更强”攻击场景(如复杂多轮注入)。4. 建立红队自动化:将GPT-Red的思路应用于其他安全领域,如越狱、隐私泄露等。

风险或限制

1. 仍有3.8%的强攻击成功:绝对数值虽小,但大规模调用时可能积累风险。2. 内部工具不公开:外界无法直接使用GPT-Red,只能依赖OpenAI的披露。3. 可能被恶意利用:类似技术若落入攻击者手中,可制造更狡猾的漏洞。4. 泛化性未知:是否适用于其他模型架构(如Claude、Gemini)尚未验证。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《OpenAI正在使用AI攻击自己的AI,效果比人类更好》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

OpenAI正在使用AI攻击自己的AI,效果比人类更好主要讲什么?

OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。

这篇文章最值得关注的要点是什么?

OpenAI训练内部AI模型GPT-Red,通过自对弈强化学习自动发现GPT模型的安全漏洞,成功率84%,远超人类13%,并将成果用于模型训练。;原贴提到:OpenAI trained an internal AI model called GPT-Red to automatically find;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI副业、AI工具、AI超级个体专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容命中「学习」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 令人惊讶:有人想要静音版本 下一篇 解密扩散模型的创造力