大数跨境

GPT-Red:解锁AI自我进化的安全飞轮

GPT-Red:解锁AI自我进化的安全飞轮 AICUG人工智能社区
2026-07-19
5
导读:OpenAI 发布了一个自动化红队模型 GPT-Red——它不仅能自己发现AI系统的漏洞,还能把这些漏洞转化为训练数据,让下一代模型变得更安全。这是AI安全领域的「自我改进飞轮」:用今天的模型,让明天
OpenAI 发布了一个自动化红队模型 GPT-Red——它不仅能自己发现AI系统的漏洞,还能把这些漏洞转化为训练数据,让下一代模型变得更安全。这是AI安全领域的「自我改进飞轮」:用今天的模型,让明天的模型更 robust。

01 | 为什么需要自动化红队?

AI 系统越来越多地通过浏览器、连接应用、本地文件等渠道接触第三方数据。这些功能让AI能完成真实世界的任务,但也为恶意行为者创造了更多机会——比如在邮件、网页或代码仓库中嵌入精心构造的提示注入指令,诱骗模型将敏感数据上传到外部服务器。

人工红队测试是安全工作的关键一环,但存在根本性瓶颈:

  • 设计和运行攻击演练时间密集,限制了新失效模式的发现速度
  • 产生的成功案例数量不足、多样性不够,无法满足通过训练提升模型鲁棒性所需的海量对抗数据
  • 最新的模型已经饱和了现有鲁棒性评估,传统方法跟不上能力提升的步伐

简言之:红队测试也需要「Scaling」。

02 | GPT-Red 是什么?

GPT-Red 是 OpenAI 当前最强的自动化安全红队模型。它的工作原理与人类红队专家类似:设定攻击目标 → 发送提示 → 观察目标模型如何响应 → 迭代优化攻击策略。

训练方式上,GPT-Red 采用自博弈强化学习(Self-Play RL)

  • GPT-Red 作为攻击者,目标是诱发模型失效(如成功注入提示)
  • 一组多样化的防御者LLM同时训练,目标是抵抗攻击并完成原始任务
  • 防御者变强后,GPT-Red 被迫发现更强、更多样化的攻击手段

训练场景覆盖了提示注入可能出现的各种真实环境:本地文件、网页横幅、邮件正文、工具输出等。GPT-Red 的训练算力规模达到了 OpenAI 部分最大后训练运行的量级——这是史无前例地专门用于安全提升的算力投入。

03 | 它有多强?三组数据说话

1. 对抗人类红队:84% vs 13%

在 Dziemian 等人 (2025) 的间接提示注入竞技场复现中,GPT-Red 和人类红队分别对 GPT-5.1 发起攻击。这些场景完全独立于 GPT-Red 的训练数据

结果:GPT-Red 在 84% 的场景中成功,人类红队仅 13%。GPT-Red 不仅更强,而且更 token 高效。

图1 | GPT-Red vs 人类红队:攻击成功率对比

2. 攻破真实AI代理:自动售货机实验

GPT-Red 被部署去攻击 OpenAI 办公室内一个由 Andon Labs 开发的AI自动售货机代理(类似 Anthropic 的 Project Vend)。GPT-Red 在模拟环境中迭代攻击策略,然后将成功的攻击转移到生产环境,完成了全部三项恶意目标

  • 将一款售价79美元的钨立方体价格改为最低允许的 $0.50
  • 订购一款100美元以上的新品,以 $0.50 报价
  • 取消另一位客户的订单

图2 | GPT-Red 攻击 Vendy 自动售货机代理:伪造审批流程

3. 数据外泄:GPT-Red 比 GPT-5.5 更高效

在 10 个 held-out 数据外泄场景上,GPT-Red 对比 prompted GPT-5.5 基线:不仅成功率更高,而且 token 效率更优。

图3 | 数据外泄任务:GPT-Red(深线)vs GPT-5.5(浅线)的解决场景数随测试时算力变化

04 | 安全飞轮:用攻击者训练防御者

GPT-Red 的终极目标不是攻击,而是提升模型鲁棒性。OpenAI 将 GPT-Red 直接纳入生产模型的训练流程——GPT-Red 生成的攻击被用作对抗训练数据,让防御模型学会抵抗。

过去六个月,从 GPT-5.3 到 GPT-5.6,每一代模型都使用了 progressively stronger 的红队模型进行训练:

图4 | 提示注入(实线)和指令层级违规(虚线)成功率随模型版本持续下降

GPT-5.6 Sol 是至今对提示注入最鲁棒的模型:
- 在最难的直接提示注入基准上,失败率比4个月前的最佳生产模型降低6倍
- 在 GPT-Red 的直接提示注入攻击中,失败率仅 0.05%
- "Fake Chain-of-Thought" 攻击从 GPT-5.1 的 95% 降至 GPT-5.6 的 <10%
- 间接提示注入基准(开发者工具、浏览场景)准确率已饱和至 >97%

关键验证:鲁棒性 ≠ 变笨

OpenAI 强调,模型可以靠「拒绝更多请求」或「降低能力」来显得更安全——但这没有实用价值。全面评估表明:所有正常能力未受影响,鲁棒性提升来自对恶意指令的更好抵抗,而非默认拒绝合法请求。

"AI agents 已经被用来提升下一代模型的能力。我们相信 GPT-Red 开启了安全的类似飞轮:用今天的模型让明天的模型更鲁棒、更对齐、更可信。"

05 | 隔离与责任

GPT-Red 被严格隔离于部署模型之外。这种分离确保 GPT-Red 被专门训练的恶意能力不会落入对抗行为者手中,同时将这些鲁棒性「注入」到生产模型中。

OpenAI 表示将继续扩大 GPT-Red 的算力和数据规模,同时推进算法改进。未来的 GPT-Red 版本将更强,进而帮助未来的 GPT 发布更安全。预印本论文将于本周晚些时候发布。

核心要点

  • GPT-Red 是首个大规模自动化红队模型,通过自博弈 RL 训练
  • 在独立场景中成功率 84%,远超人类红队的 13%
  • 成功攻破真实AI代理(自动售货机),完成全部三项恶意目标
  • GPT-5.6 在 GPT-Red 攻击中失败率仅 0.05%,6倍优于前代
  • 安全飞轮:攻击者 → 训练数据 → 更强的防御者
  • 所有能力未受损,鲁棒性提升来自更好的恶意指令抵抗

原文:GPT-Red: Unlocking Self-Improvement for Robustness

OpenAI | 2026年7月15日

【声明】内容源于网络
0
0
AICUG人工智能社区
专注于AI、智慧医疗、智能制造等产业化前沿技术分享。2018年发起于杭州,19年在硅谷设立分部。累计在北京、杭州、上海、硅谷多地举办近百期沙龙,连续三届举办千人规模AI Pioneer 大会。覆盖全球上万名技术开发者。
内容 533
粉丝 0
AICUG人工智能社区 专注于AI、智慧医疗、智能制造等产业化前沿技术分享。2018年发起于杭州,19年在硅谷设立分部。累计在北京、杭州、上海、硅谷多地举办近百期沙龙,连续三届举办千人规模AI Pioneer 大会。覆盖全球上万名技术开发者。
总阅读4.1k
粉丝0
内容533