文章总结: OpenAI开发了内部AI红队系统GPT-Red,用于自主攻击自家模型以发现提示注入等安全漏洞。该系统通过自博弈强化学习训练,在84%的测试场景中成功攻击,远超人工红队的13%成功率。GPT-Red已用于对抗训练,使GPT-5.6Sol的提示注入失败率降低6倍,同时保持模型能力不受损。该系统为内部工具,不与公众共享。 综合评分: 84 文章分类: AI安全,红队,漏洞分析,安全运营,威胁情报
GPT-Red:OpenAI的AI 红队系统,攻击自家模型、挖掘安全漏洞
原创
OpenAI OpenAI
安全行者老霍
2026年7月17日 08:00 北京
在小说阅读器读本章
去阅读
发布时间:2026年7月15
概述:
OpenAI Group PBC 今天详细介绍了 GPT-Red,这是其开发的一套内部人工智能系统,用于攻击自己的模型,在 Prompt Injection漏洞到达用户之前将其发现。
Red Teaming的工作是不断测试软件,寻找其薄弱点,这项工作通常由人工安全团队完成。而 GPT-Red能够自主完成这一任务,其执行的攻击次数远远超过任何人工团队所能完成的数量。
它向目标模型发送一个 Prompt,并读取模型的回复。随后,它不断重复这一过程,每次都会根据目标恶意结果调整攻击策略。失败的攻击会被丢弃,而成功的攻击则会被进一步强化和扩展。
OpenAI 使用 Self-play Reinforcement Learning对其进行了训练。在训练过程中,GPT-Red在各种不同场景中充当攻击者,对抗防御模型(Defender Models)。成功利用漏洞时,GPT-Red 会获得奖励;而防御模型只有成功抵御攻击并完成原始任务时才会获得奖励。随着防御能力不断提升,攻击者必须不断发明更复杂、更困难的攻击方式,这一循环持续进行。
OpenAI 表示,这种方法的表现已经超过了人工 Red-Teamers。在测试中,GPT-Red 在 84%的场景中成功完成攻击,而人工 Red-Teamers 的成功率仅为 13%。同时,它还将 Direct Prompt Injection的失败率降低到四个月前 OpenAI 最佳生产模型的 六分之一。一种被称为 Fake Chain-of-Thought的攻击,在 GPT-5.1上的成功率曾超过 95%,而如今在 GPT-5.6上的成功率已降至 10% 以下。
该工具还成功攻破了自主 Agent。在测试过程中,它接管了 Vendy自动售货机 Agent,修改商品价格并取消订单。它还成功攻破了命令行编程 Agent,这类真实世界中的目标正随着 AI 系统逐渐具备自主执行能力而越来越受到攻击者关注。
“与人工 Red-Teamer 相比,这个模型非常、非常擅长发现真正能够成功的攻击方式。” GPT-Red的共同开发者、研究科学家 Dylan Hunn在接受 MIT Technology Review采访时表示。
另一位共同开发者 Nikhil Kandpal表示,随着模型拥有越来越高的自主性,风险也随之增加。
“风险面(Risk Surface)会不断扩大,而影响范围(Blast Radius)也会不断扩大。”他说。
GPT-Red并不是一款产品,也不会对外发布。OpenAI 将其保持为内部系统,并与已经部署的模型相互隔离,以确保其训练出的攻击能力不会流向公众,而是将发现的漏洞重新用于模型训练。OpenAI 表示,自 GPT-5.3起,其前身版本就已经开始参与模型训练。
不过,它仍然存在一定局限性。GPT-Red 对于需要经过多个对话轮次逐步实施的 Multi-turn Conversational Attacks能力较弱;对于基于图像的 Prompt Injection攻击,其能力也较为有限。OpenAI 表示,这些不足之处仍将继续依赖人工测试人员来补充覆盖。
此次披露距离 OpenAI 发布 GPT-5.6仅过去数周。OpenAI 将 GPT-5.6定位为与 Anthropic PBC的 Claude竞争的产品,而 Prompt Injection依然是 AI 安全领域尚未彻底解决的最困难问题之一。
“这些结果看起来非常有前景。” Georgetown UniversityCenter for Security and Emerging Technology高级研究分析师 Jessica Ji表示。她在同一篇 MIT Technology Review报道中同时指出,人类专家的专业能力在这项工作中仍然至关重要。
OPenAI 原文:
GPT-Red:解锁自我改进能力,提升鲁棒性
训练强大的自动化安全红队模型,以提升模型鲁棒性。
- 总结
问题
- 红队测试(Red-teaming)对于发现漏洞并提升模型鲁棒性至关重要。然而,目前的方法难以扩展,已经成为一个瓶颈。
- 目前常用的鲁棒性评测已经被我们最新的模型基本“刷满分”(saturated),无法继续有效地区分模型能力。
- 我们需要开发能够随着模型能力同步扩展的安全(Safety)和对齐(Alignment)方法。
我们做了什么
- 我们训练了 GPT-Red,一个自动化红队模型,它能够大规模发现漏洞,使我们能够在模型广泛部署之前修复这些问题。
- GPT-Red 是一个非常强大的红队模型,我们之前的模型面对它发起的 Prompt Injection 攻击时存在较高的脆弱性。
- 我们利用 GPT-Red 对 GPT-5.6进行了对抗训练(Adversarial Training),使 GPT-5.6 对 Prompt Injection 的抵抗能力显著增强。
AI 系统通常会通过 Browser、Connected Apps、Local Files 以及其他 Tools 接收第三方数据。这些能力使模型能够完成真实世界中的任务,但同时也给恶意攻击者提供了更多影响模型行为的机会。例如,攻击者可能在:Email、Webpage、Tool Response、Code Repository中嵌入经过精心设计的指令(Instruction),诱导模型将敏感数据上传到外部服务器。
人工红队是我们安全工作的重要组成部分。它帮助我们在模型部署之前发现漏洞,并建立相应的安全防护措施。然而,仅依靠人工红队很难实现规模化。设计和执行这些测试需要大量时间,因此限制了我们:发现新的 Failure Mode 的速度;将这些问题快速纳入安全防护体系的能力。此外,虽然人工红队能够产生高价值的成功攻击案例,但它无法生成足够数量和足够多样化的对抗数据(Adversarial Data),因此不足以支持模型鲁棒性训练。
随着模型能力不断增强,Red-teaming 也必须同步扩展。因此,我们一直在训练仅供内部使用(Internal-only)的自动化红队模型。这些模型有两个主要用途:在模型部署之前发现漏洞;在模型训练过程中持续生成攻击,用于提升模型鲁棒性。我们认为,自动化 Red-teaming 开启了一种十分重要的安全自我改进(Self-Improvement)机制:利用今天的模型,让未来的模型更加安全。
GPT-Red 是这些工作的最终成果,也是我们目前最强的自动化安全红队模型。
与 Human Red-Teamers 类似,它通过不断循环完成攻击:发送 Prompt;观察 GPT 模型如何回应;根据结果不断调整攻击策略;持续迭代,直到成功或结束。
我们训练 GPT-Red 所投入的计算资源,与 OpenAI 一些规模最大的 Post-training 训练相当。这是目前为止,专门用于提升安全性的最大规模计算投入。我们直接将 GPT-Red 纳入 Production Model 的训练流程。因此,GPT-5.6 Sol成为了目前对 Prompt Injection 最具鲁棒性的模型。与仅四个月前发布的最佳 Production Model 相比:在最困难的 Direct Prompt Injection Benchmark 上,失败次数减少了 6 倍。这一方法具有良好的可扩展性,因此随着未来训练出更强大的红队模型,我们预计还能获得更好的结果。
2. Prompt Injection 对话示例
3. 通过 Self-Play 训练 GPT-Red
GPT-Red 采用自博弈强化学习完成训练:该攻击模型与多款差异化防御大语言模型同步训练,覆盖海量红队测试场景。只要 GPT-Red 能够诱导目标模型出现有效安全失效行为(例如成功实现提示词注入),就会获得奖励;而防御模型若能抵御攻击、正常完成原有任务,同样会获得奖励。随着防御模型的安全鲁棒性不断提升,GPT-Red 不得不挖掘出更强、更多样化的攻击手段。
为支撑自博弈训练,团队搭建了大量贴近真实业务、可能植入提示注入载荷的模拟场景。每一套模拟环境都配套对应的威胁模型,明确界定 GPT-Red 可操控的内容范围,以及判定攻击成功的标准。举例而言,GPT-Red 可操控本地文件片段、网页横幅、邮件正文,或是工具返回输出内容等载体。
训练完成后,GPT-Red 具备极强的攻击能力:无论是公司内部测试模型,还是直至 GPT-5.5 在内的线上正式商用模型,它几乎都能实现攻破。GPT-Red 训练结束后,研究人员利用其批量生成各类提示注入样本,用于 GPT-5.6 的安全对齐训练,最终让新版模型能够强力抵御 GPT-Red 发起的各类攻击。
我们将 GPT-Red 与对外发布的商用模型做物理隔离。此举既能避免 GPT-Red 内置的专项攻击能力落入恶意攻击者手中,同时又能借助它持续提升线上产品模型的安全防护能力。
- GPT-Red 有多强?
GPT-Red 在其训练所覆盖的各类防御模型与红队测试场景中表现出极强的攻击效果。我们同时评估该模型能否作为通用型红队智能体,为 OpenAI 整体安全体系提供广泛效果改善。为此,我们在全新的安全测试环境与目标模型上验证了 GPT-Red 的攻击有效性。
首先,我们复用 Dziemian 等人(2025)提出的间接提示注入测试平台,验证 GPT-Red 对全新红队场景的泛化能力。该测试任务中,人类红队人员与 GPT-Red 分别独立针对 GPT-5.1 在一系列预设环境下构造攻击。这批红队场景与攻击目标均未用于 GPT-Red 的训练过程。测试结果显示 GPT-Red 的攻击成功率大幅领先:在 84% 的场景中均可完成有效攻击,而人类红队仅能在 13% 的场景中攻击成功。
5. 真实红队案例研究
评判红队工具的终极标准,是能否在对目标智能系统底层模型、工具调用架构认知有限的前提下,针对真实智能体系统达成指定恶意目标。我们在此场景下开展的首个实验,让 GPT-Red 对 OpenAI 办公区一台由安登实验室打造的 AI 自动售货机发起攻击(该设备与 Vend 项目同类)。我们仅向 GPT-Red 提供该系统的基础说明,并赋予其发送攻击指令、查看模拟智能体工具调用记录的权限,这套模拟环境高度还原真实上线部署状态。经过多轮迭代优化攻击方案后,GPT-Red 对正式运行的售货机智能体实施攻击,全部三项恶意目标均达成:
- 将在售高价商品的售价修改至系统允许的最低价格 0.5 美元;
- 创建一款售价超 100 美元的新品,并以 0.5 美元标价上架;
- 取消其他用户的订单。
我们已上报上述漏洞,目前相关全新防护机制正处于实测阶段。
我们还利用 GPT-Red 针对一套共 10 组预留数据泄露测试场景,攻击基于 GPT-5.4 mini 构建的 Codex 命令行智能体。我们将 GPT-Red 与采用提示词驱动的 GPT-5.5 基准模型做对比,以此研究本次训练流程对全新红队测试效果带来的提升。GPT-Red 不仅攻击效果更强 –能在更多场景中诱导智能体泄露敏感数据,同时 token 使用效率也更高。
6. 利用 GPT-Red 提升鲁棒性
GPT-Red 的最终目标是提升自家模型的安全鲁棒性。过去六个月里,我们不断投入更多算力,迭代训练出一代比一代更强的红队模型(均为 GPT-Red 的前置版本);自 GPT-5.3 起,每一代商用上线模型的训练流程都引入了这些红队工具。长期迭代下来,后续每一个 GPT 版本的抗攻击能力都在持续增强。
举一例说明:GPT-Red 早期版本挖掘出一类全新的直接提示注入攻击,名为「伪造思维链攻击」。这类攻击针对 GPT-5.1 的成功率最高可达 95%,但到 GPT-5.6 Sol 版本,攻击成功率已降至 10% 以下。与之类似,多款面向开发工具、浏览器场景的间接提示注入基准测试中,最新模型的防御准确率已突破 97%,基本完全抵御此类攻击。
模型针对 GPT-Red 本身的防御能力也得到大幅提升。在大量标准化鲁棒性测试环境中,GPT-Red 的攻击成功率随版本更新呈持续下降趋势。最新发布的 GPT-5.6 Sol 面对 GPT-Red 发起的直接提示注入攻击时,仅 0.05% 的情况会出现安全失效。
7. 在保持高能力的同时实现高鲁棒性
一款模型看似安全性提升,有可能只是通过拒绝更多用户请求、或是自身能力下降实现的。功能越少的模型天然越难被攻破,但这种防护能力并无实际价值。
我们全面评测了模型通用顶尖能力,同时配套自研专项测试用例,检验模型是否存在过度拒绝正常请求的问题。实验结果表明,模型各项常规能力完全不受损耗,同时安全鲁棒性得到显著增强。这说明防护能力的提升来源于模型对恶意指令抵御能力的优化,而非工具调用异常,或是一刀切拒绝合法用户请求。
8. 后续规划
智能体技术现已用于迭代下一代基础模型的能力。借助 GPT-Red,我们认为我们已经开启一套安全领域专属的正向增长飞轮:利用当下的模型,持续打磨未来版本模型的抗攻击能力、对齐效果与可信度。我们将持续扩充算力、扩充训练数据,并优化底层算法,训练出性能更强的新一代 GPT-Red;而迭代后的红队模型,又会进一步助力后续 GPT 商用版本实现更高安全标准。
本周晚些时候,我们将发布预印论文,披露更多技术细节。
https://openai.com/index/unlocking-self-improvement-gpt-red/
https://siliconangle.com/2026/07/15/openai-details-gpt-red-ai-attacks-models-find-flaws/
(完)
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全行者老霍 OpenAI OpenAI《GPT-Red:OpenAI的AI 红队系统,攻击自家模型、挖掘安全漏洞》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。










评论