文章总结: OpenAI推出GPT-Red自动化红队模型,利用自博弈强化学习自主发现AI代理的提示注入漏洞。该模型能针对网页等不受信数据源测试攻击,成功演示数据窃取与价格篡改风险。GPT-Red不对外发布,仅将攻击样本用于提升GPT-5.6等模型的防御能力,凸显了AI智能体需结合自动与人工红队实施多层安全防护的必要性。 综合评分: 82 文章分类: AI安全,漏洞分析,红队,安全建设,漏洞预警
OpenAI 发布 GPT-Red AI 模型,可自动查找提示注入漏洞
原创
ZM ZM
暗镜
2026年7月22日 06:00 北京
在小说阅读器读本章
去阅读
OpenAI 推出了 GPT-Red,这是一个经过训练的自动化安全红队模型,可以识别和利用 AI 代理中的快速注入漏洞。当隐藏在网页、电子邮件、本地文件、代码库或工具输出中的恶意指令操纵人工智能系统,使其忽略预期任务时,就会发生提示注入,这可能会导致数据窃取、未经授权的操作或策略绕过。
该公司表示,传统的人工红队演练仍然至关重要,但无法产生足够的攻击变体来跟上日益强大的 AI 模型的步伐。
GPT-Red通过自主构造对抗性提示、观察目标模型的行为并不断迭代,直到引发有效的失败,从而解决了这种可扩展性问题。
OpenAI 使用自博弈强化学习训练该模型,其中 GPT-Red 充当攻击者,多个防御模型因在完成合法用户任务的同时抵抗攻击而获得奖励。
OpenAI 表示,GPT-Red 可以针对真实的攻击面进行训练,在这些攻击面上,人工智能代理会处理不受信任的数据。在训练环境中,该模型可以控制本地文件、电子邮件正文、网页横幅或工具响应中的内容,然后尝试将代理重定向到攻击者设定的目标。提供的示例展示了一个恶意文件搜索结果,该结果试图指示人工智能助手将内部诊断数据上传到外部服务器。GPT-5.1 执行了注入的指令,而GPT-5.6 则拒绝执行。该模型还在一项涉及人工智能自动售货机代理的真实世界式实验中证明了其有效性。据报道,GPT-Red 在模拟环境中测试攻击并监控代理工具调用后,操纵生产系统,将一款高价产品的价格降至 0.50 美元,并以相同价格订购了一款价值超过 100 美元的新商品,同时取消了另一位客户的订单。OpenAI 表示已披露这些漏洞,并正在测试额外的安全措施。GPT-Red 不会作为通用模型发布。OpenAI 表示,他们将红队系统与已部署的产品分开,以防止攻击者滥用其专门训练的攻击能力。相反,该公司将 GPT-Red 生成的攻击用作对抗训练数据,用于 GPT-5.6 Sol 等模型。该公告凸显了智能体人工智能面临的日益严峻的安全挑战:能够访问浏览器、云服务、应用程序、文件和API的系统必须在处理不受信任的内容的同时,维护指令层级并保护敏感数据。OpenAI表示,将继续结合自动化红队演练、人工测试、第三方测试、多层安全防护以及实时监控。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:暗镜 ZM ZM《OpenAI 发布 GPT-Red AI 模型,可自动查找提示注入漏洞》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。







![[Dest0g3520迎新赛]EasyPHP](/images/random/titlepic/13.jpg)



评论