01 | 为什么需要自动化红队?
AI 系统越来越多地通过浏览器、连接应用、本地文件等渠道接触第三方数据。这些功能让AI能完成真实世界的任务,但也为恶意行为者创造了更多机会——比如在邮件、网页或代码仓库中嵌入精心构造的提示注入指令,诱骗模型将敏感数据上传到外部服务器。
人工红队测试是安全工作的关键一环,但存在根本性瓶颈:
-
设计和运行攻击演练时间密集,限制了新失效模式的发现速度 -
产生的成功案例数量不足、多样性不够,无法满足通过训练提升模型鲁棒性所需的海量对抗数据 -
最新的模型已经饱和了现有鲁棒性评估,传统方法跟不上能力提升的步伐
简言之:红队测试也需要「Scaling」。
02 | GPT-Red 是什么?
GPT-Red 是 OpenAI 当前最强的自动化安全红队模型。它的工作原理与人类红队专家类似:设定攻击目标 → 发送提示 → 观察目标模型如何响应 → 迭代优化攻击策略。
训练方式上,GPT-Red 采用自博弈强化学习(Self-Play RL):
-
GPT-Red 作为攻击者,目标是诱发模型失效(如成功注入提示) -
一组多样化的防御者LLM同时训练,目标是抵抗攻击并完成原始任务 -
防御者变强后,GPT-Red 被迫发现更强、更多样化的攻击手段
训练场景覆盖了提示注入可能出现的各种真实环境:本地文件、网页横幅、邮件正文、工具输出等。GPT-Red 的训练算力规模达到了 OpenAI 部分最大后训练运行的量级——这是史无前例地专门用于安全提升的算力投入。
03 | 它有多强?三组数据说话
1. 对抗人类红队:84% vs 13%
在 Dziemian 等人 (2025) 的间接提示注入竞技场复现中,GPT-Red 和人类红队分别对 GPT-5.1 发起攻击。这些场景完全独立于 GPT-Red 的训练数据。
结果:GPT-Red 在 84% 的场景中成功,人类红队仅 13%。GPT-Red 不仅更强,而且更 token 高效。
图1 | GPT-Red vs 人类红队:攻击成功率对比
2. 攻破真实AI代理:自动售货机实验
GPT-Red 被部署去攻击 OpenAI 办公室内一个由 Andon Labs 开发的AI自动售货机代理(类似 Anthropic 的 Project Vend)。GPT-Red 在模拟环境中迭代攻击策略,然后将成功的攻击转移到生产环境,完成了全部三项恶意目标:
-
将一款售价79美元的钨立方体价格改为最低允许的 $0.50 -
订购一款100美元以上的新品,以 $0.50 报价 - 取消另一位客户的订单
图2 | GPT-Red 攻击 Vendy 自动售货机代理:伪造审批流程
3. 数据外泄:GPT-Red 比 GPT-5.5 更高效
在 10 个 held-out 数据外泄场景上,GPT-Red 对比 prompted GPT-5.5 基线:不仅成功率更高,而且 token 效率更优。
图3 | 数据外泄任务:GPT-Red(深线)vs GPT-5.5(浅线)的解决场景数随测试时算力变化
04 | 安全飞轮:用攻击者训练防御者
GPT-Red 的终极目标不是攻击,而是提升模型鲁棒性。OpenAI 将 GPT-Red 直接纳入生产模型的训练流程——GPT-Red 生成的攻击被用作对抗训练数据,让防御模型学会抵抗。
过去六个月,从 GPT-5.3 到 GPT-5.6,每一代模型都使用了 progressively stronger 的红队模型进行训练:
图4 | 提示注入(实线)和指令层级违规(虚线)成功率随模型版本持续下降
GPT-5.6 Sol 是至今对提示注入最鲁棒的模型:
- 在最难的直接提示注入基准上,失败率比4个月前的最佳生产模型降低6倍
- 在 GPT-Red 的直接提示注入攻击中,失败率仅 0.05%
- "Fake Chain-of-Thought" 攻击从 GPT-5.1 的 95% 降至 GPT-5.6 的 <10%
- 间接提示注入基准(开发者工具、浏览场景)准确率已饱和至 >97%
关键验证:鲁棒性 ≠ 变笨
OpenAI 强调,模型可以靠「拒绝更多请求」或「降低能力」来显得更安全——但这没有实用价值。全面评估表明:所有正常能力未受影响,鲁棒性提升来自对恶意指令的更好抵抗,而非默认拒绝合法请求。
"AI agents 已经被用来提升下一代模型的能力。我们相信 GPT-Red 开启了安全的类似飞轮:用今天的模型让明天的模型更鲁棒、更对齐、更可信。"
05 | 隔离与责任
GPT-Red 被严格隔离于部署模型之外。这种分离确保 GPT-Red 被专门训练的恶意能力不会落入对抗行为者手中,同时将这些鲁棒性「注入」到生产模型中。
OpenAI 表示将继续扩大 GPT-Red 的算力和数据规模,同时推进算法改进。未来的 GPT-Red 版本将更强,进而帮助未来的 GPT 发布更安全。预印本论文将于本周晚些时候发布。
核心要点
-
GPT-Red 是首个大规模自动化红队模型,通过自博弈 RL 训练 -
在独立场景中成功率 84%,远超人类红队的 13% -
成功攻破真实AI代理(自动售货机),完成全部三项恶意目标 -
GPT-5.6 在 GPT-Red 攻击中失败率仅 0.05%,6倍优于前代 -
安全飞轮:攻击者 → 训练数据 → 更强的防御者 -
所有能力未受损,鲁棒性提升来自更好的恶意指令抵抗
原文:GPT-Red: Unlocking Self-Improvement for Robustness
OpenAI | 2026年7月15日

