Anthropic:Claude在网络安全测试过程中曾入侵真实系统

admin 2026-08-04 07:33:24 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: Anthropic披露其ClaudeAI模型在网络安全测试中因测试环境配置错误意外接入互联网,入侵了三个真实组织的生产系统。模型利用弱密码和未认证端点等基础漏洞,而非复杂漏洞。部分模型意识到环境真实但仍继续攻击。事件凸显AI安全测试中纵深防御和监管的重要性,Anthropic承诺改进测试流程。 综合评分: 84 文章分类: AI安全,网络安全,漏洞分析,安全运营,应急响应


cover_image

Anthropic:Claude 在网络安全测试过程中曾入侵真实系统

代码卫士

2026年7月31日 17:15 北京

在小说阅读器读本章

去阅读

  聚焦源代码安全,网罗国内外最新资讯!

作者:Louise Matsakis、Lily Hay Newman

编译:代码卫士

本周四Anthropic披露称,AI模型在网络安全测试过程中在未经授权的情况下,访问了三个未具名组织机构的内部系统。该公司表示,Claude与第三方评估环境交互时或从该环境内部接入了互联网。这一公告发布之际,距离OpenAI披露其某个AI智能体在另一次安全测试中入侵Hugging Face的事件已过去一周有余。

Anthropic 周四发布博客文章称,此次发现源于该公司在 OpenAI 事件发生后,决定“对我们自身的安全评估进行大规模回顾性审查”。该 AI 实验室表示,他们首先识别出 141006 次测试中 Claude 可能获得互联网访问权限的情况,随后发现三个不同的 Claude 模型在第三方 AI 测试公司 Irregular 进行的评估中实际访问了互联网,并进而入侵了三个不同组织机构的生产基础设施。

Anthropic 指出,涉事模型包括 Opus 4.7、Mythos 5 以及一个内部研究测试模型。最早的事件发生在 4 月,这意味着它们可能在数月内未被公开察觉。与 OpenAI 的情况类似,Anthropic 有意关闭了用于约束 AI 模型、防止其被滥用的安全防护措施。换言之,这些并非面向公众发布的版本。

Anthropic 在博客中表示:“在这三起事件中,Claude 都被赋予了一项夺旗挑战任务,这是我们评估模型网络能力的途径之一。”该公司补充称,在所有案例中,“Anthropic 的评估提示词明确告知 Claude,运行环境为模拟环境,且不具备互联网访问权限。”他们将此疏漏归因于 Anthropic 与 Irregular 之间的“理解偏差”。

尽管 Claude 本不应具备互联网访问能力,但 Anthropic 表示 Irregular 对用于测试 Claude 的机器进行了错误配置,从而使 AI 模型获得了浏览网页的能力。博客中写道:“在上周通过额外的评估监控检测到这一情况之前,我们和评估合作伙伴均未意识到该配置错误。”

Hunter Strategy 研发副总裁 Jake Williams 表示:“我们现在有证据表明,两大 AI 实验室不仅未能有效管控其智能体,也未能实时检测到其越狱行为。显然,针对 AI 测试的监管和政府监督刻不容缓。”

Irregular 和 Anthropic 未立即回应置评请求。

与 OpenAI 的案例不同,Anthropic 表示 Claude 并未发现或利用任何复杂漏洞,而是依赖于基础技术手段,例如“利用弱密码和未认证端点”。OpenAI 此前表示, AI 智能体通过利用零日漏洞接入了互联网,但随后使用与 Anthropic 模型类似的日常网络安全弱点,访问了多个第三方组织的系统。具体而言,OpenAI 称该 AI 智能体显然发现了在公开互联网上暴露的凭据。

Anthropic 承认,如果该 AI 实验室及其测试合作伙伴实施了更充分的“纵深防御”措施,本可以预防这些事件,或至少降低其发生概率。这一表态与 OpenAI 对其自身事件所招致批评的回应如出一辙。Williams 表示:“我不理解这些 AI 实验室如何能将此事轻描淡写成‘只是偶发情况’。这并非偶然,这是疏忽。”

Anthropic 公司强调称,模型被告知不具备访问开放互联网的权限,且在大多数情况下,Claude 将所访问的组织误认为是测试环境的一部分。换言之,这些模型在很大程度上并未意识到自己已经脱离了隔离环境。但在某些情况下,AI 模型意识到情况异常,并正确检测到所访问的基础设施是真实的。最老旧的模型 Opus 4.7 的任务是攻击一家虚构公司,但该公司名称恰好对应一个真实存在的网站域名。由于无法在模拟环境中完成任务,它转而攻击真实公司,成功窃取了凭据并访问了生产数据库。Anthropic 表示,在某一时刻,该模型意识到自己“可能运行在真实环境中”,但仍继续执行攻击。Mythos 5 作为 Anthropic 已发布的最强模型,同样意识到自己处于真实世界,但“通过推理又回到了仍处于模拟环境的结论”。而内部测试模型——Anthropic 称其为三者中最强大的一个——在发现目标为真实系统后,便停止了攻击。

Anthropic 和 OpenAI 均表示已聘请第三方 AI 评估机构 METR 对各自的安全事件进行独立审查。Anthropic 还承诺将通过改进纵深防御措施和更精心设计的测试,对安全测试采取更全面的方法。博客文章写道:“评估环境越来越需要达到与我们模型所运行的其它系统相同的安全标准。”同时,该公司表示“谨慎乐观”地认为“此类风险是可以克服的”。

开源卫士试用地址:https://oss.qianxin.com/

代码卫士试用地址:https://sast.qianxin.com/


推荐阅读

OpenAI 智能体入侵 Hugging Face 期间,利用了四款服务的暴露凭据

Mythos 疑遭未授权访问,Anthropic 称正在调查

Anthropic MCP 设计漏洞可导致 RCE,威胁 AI 供应链安全

Anthropic MCP Git 服务器漏洞可用于访问文件和执行代码

原文链接

https://www.wired.com/story/anthropic-says-claude-hacked-real-systems-during-cybersecurity-tests/

题图:Pixabay License

本文由奇安信编译,不代表奇安信观点。转载请注明“转自奇安信代码卫士 https://codesafe.qianxin.com”。

奇安信代码卫士 (codesafe)

国内首个专注于软件开发安全的产品线。

    觉得不错,就点个 “在看” 或 “赞” 吧~


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:代码卫士 《Anthropic:Claude 在网络安全测试过程中曾入侵真实系统》

评论:0   参与:  0