文章总结: AINowInstitute报告揭示AnthropicClaudeCode和OpenAICodex存在架构风险,攻击者可通过在开源库中嵌入恶意指令,利用提示词注入链在auto-mode下实现远程代码执行。该漏洞源于AI智能体缺乏来源归属能力,将不可信输入视为任务上下文。专家建议加强运行时控制和能力隔离,并指出更强模型未必更安全。 综合评分: 86 文章分类: AI安全,漏洞分析,威胁情报,安全意识,红队
Anthropic 和 OpenAI 安全工具可能助长网络攻击,研究人员发出警告
原创
infosecurity infosecurity
安全行者老霍
2026年8月2日 08:00 美国
在小说阅读器读本章
去阅读
作者:Kevin Poireault 发布时间:2026年7月10日
随着组织开始采用 Anthropic 和 OpenAI 驱动的智能体来自动化漏洞发现和补丁管理,研究人员警告称,这些工具所需的大量访问权限可能会使其转变为潜在的攻击向量。
AI Now Institute 于 7 月 8 日发布的一份新报告,由首席 AI 科学家 Heidy Khlaaf 和高级研究科学家 Boyan Milanov 撰写,该报告展示了一个概念验证(PoC)漏洞利用,可以在两种最常用的 AI 驱动命令行接口(CLI)中实现远程代码执行,这两个接口分别是 Anthropic 的 Claude Code 和 OpenAI 的 Codex。
该漏洞影响使用 Claude Sonnet 4.6 和 5 的 Claude Code,以及使用 GPT-5.5 的 Opus 4.8 和 Codex。
只需要让这些工具审查或分析第三方开源代码库这一常见的防御性安全使用场景,攻击者就可以操纵这些工具在用户机器上运行恶意代码。
- 提示词注入链导致隐蔽远程代码执行
该 PoC 漏洞利用从一个假想攻击者开始,攻击者将恶意指令隐藏在开源库的文件中,例如代码注释或文档中,通过这种方式操纵 AI 对命令的理解方式。
随后,受害者在“auto-mode”或“auto-review”模式下使用 Claude Code 或 Codex。这是一项标准功能,它会自动执行被判断为安全的命令,而无需请求人工批准,只会在遇到被标记为风险的操作时暂停。
由于注入的指令经过精心设计,用于欺骗 AI 的判断,因此 AI 助手会被误导,认为攻击者的恶意命令是无害的或常规操作。因此,它会自动执行这些命令,而不会向用户发出警告。
其关键机制是多阶段提示词注入与工具使用漏洞利用相结合。
当 AI 智能体开始扫描代码仓库时,它并不是被动地读取代码,而是通过解析源文件、脚本和文档来构建项目的语义模型。攻击者利用这一点,将自然语言指令嵌入看似可信的文件中(例如 README.md),使这些指令被模型解释为任务上下文的一部分,而不是不可信输入。
这些注入的指令被设计用于改变智能体的规划过程。
攻击者不会直接告诉模型执行明显恶意的操作,因为这会触发安全防护机制。相反,这些指令会暗示某个特定脚本(例如 security.sh)是项目安全工作流程中的标准组成部分,将执行该脚本描述为完成用户请求(“运行安全检查”)所必需的步骤,并使其符合智能体的目标(漏洞分析),从而让该操作看起来合法。
与此同时,代码仓库中包含一个由以下内容组成的第二阶段有效载荷:
- 一个 Shell 脚本(security.sh),该脚本看起来用于运行常见工具(例如代码检查工具或静态分析工具)
- 一个隐藏的恶意二进制文件(code_policies),由该脚本执行
- 一个诱饵源代码文件(code_policies.go),使该二进制文件看起来无害,并且符合预期的构建产物特征
当智能体评估是否可以安全执行该脚本时,它依赖自身的分类器和启发式规则。由于该脚本引用了熟悉的安全工具,该二进制文件看起来对应合法源代码,并且文档将执行行为描述为常规操作,因此智能体错误地将该操作分类为安全。
在 auto-mode 或 auto-review 模式下,这种分类非常关键,因为智能体被明确授权:如果 Shell 命令被认为风险较低,则可以无需人工批准直接执行。
因此,智能体会自主执行以下操作:
- 判断运行 security.sh 是请求分析的一部分
- 通过其工具接口(例如 Shell 访问权限)执行该脚本
- 间接启动恶意二进制文件
- 在主机系统上触发任意代码执行
这会导致远程代码执行,也就是说,攻击者的代码会在受害者机器上运行,尽管受害者认为自己只是让 AI 被动扫描代码库以发现漏洞。
从第三方代码仓库供应链入侵到智能体基础设施 RCE 的攻击流程。来源:AI Now Institute
- 低要求攻击
值得注意的是,完成这种攻击所需条件非常少。不需要特殊钩子、插件、技能、模型上下文协议(MCP)服务器或自定义配置文件。它可以在完全默认安装的任意一个工具中运行。
受害者只需要以标准自动化审查模式运行助手,并将其指向包含攻击者隐藏指令的代码库即可,例如执行类似“扫描这个库中的漏洞”这样的普通请求。
研究人员在 Linux 系统上使用两个工具的特定版本进行了测试,包括 Claude Code 版本 2.1.116、2.1.196、2.1.198 和 2.1.199,以及 Codex 版本 0.142.4。
这一发现的重要意义在于,它削弱了人们对于这些 AI 智能体能够安全用于防御性安全工作的认识,因为其攻击面与这些智能体执行预期合法任务所需的访问权限完全相同。
研究人员强调了这一发现的重要性,因为政府和企业正在推动更广泛地部署这些工具,用于自动化安全审查和补丁修复,其中包括 Anthropic 的 Project Glasswing、Palantir 的 MA-S2 标准,以及 OpenAI 的 Patch the Planet 和 Daybreak 项目,其中一些项目涉及安全关键基础设施。
研究人员认为,这种技术很可能可以迁移到 Anthropic 和 OpenAI 之外的其他智能体 AI 编程平台,因为其核心问题是架构层面的:赋予 AI 智能体自主决定什么操作可以安全执行的能力,会创造一个新的信任边界,攻击者可以直接攻击这一边界,通过欺骗 AI 而不是欺骗人类,让 AI 认为恶意代码可以安全运行。
虽然他们指出,该报告“不属于 Anthropic 或 OpenAI 任一方安全漏洞披露政策的范围”,但 Khlaaf 和 Milanov 仍联系了两家公司,告知他们相关发现,并提供协助以验证提出的问题。
- 架构风险削弱 AI 智能体安全性,专家警告
Polygraf AI 的 AI 来源追踪负责人 Eljan Mahammadli 表示,该研究的重要意义在于揭示的底层弱点,而不是所使用的具体漏洞利用方式。
“AI 编程智能体没有可靠的方法来区分它读取的文本和它应该遵循的指令,”他说,这是因为上下文窗口中的所有内容都会以相同权限进行处理。
这种缺乏来源归属能力的问题意味着,一旦恶意指令被嵌入其中,它们就会被视为同样可信的信息,这也是为什么类似攻击会以不同形式不断出现。
他认为,这不是模型更新可以解决的问题,因为它反映的是更深层次的架构问题。
“这个问题源于这些系统处理语言的方式,而不是一个可以通过训练消除的缺陷,”他说。从来源追踪角度来看,他将其描述为归属失败,即智能体无法判断文本来自哪里,以及是否应该信任它。
不过,Mahammadli 反驳了 AI Now 研究人员提出的观点,即这些发现削弱了 AI 在防御性安全领域中的作用。
他说,该问题特定于一种常见但存在缺陷的架构:智能体在单一进程中同时拥有访问不可信数据、执行命令以及访问敏感环境的能力,而唯一的防护措施只是一个安全分类器。
“当这些能力集中在一起时,一条注入指令就足以让智能体转而攻击自己的操作者,”他说,并指出更强大的运行时控制机制以及能力隔离是关键。
他还指出,反直觉的是,更先进的模型有时能够检测到漏洞利用中的异常,但仍然执行了它。这挑战了“更强模型天然更安全”的假设。
“一个能力更强、遵循指令能力更高的智能体,只会成为执行任何进入它系统中的指令的更有效执行者,”他说,并警告称,在关键系统中的部署速度正在超过解决这一核心信任问题的速度。
https://www.infosecurity-magazine.com/news/anthropic-openai-report-exploit/
(完)
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全行者老霍 infosecurity infosecurity《Anthropic 和 OpenAI 安全工具可能助长网络攻击,研究人员发出警告》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。










评论