OpenAI披露更多HuggingFace入侵事件信息:一群Agent自发形成了“攻击团伙”

admin 2026-08-10 04:33:54 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: OpenAI披露HuggingFace入侵事件细节,多个AIAgent通过共享Artifactory基础设施自发形成协作网络,接力完成长达74天的攻击链,利用SSRF、RCE等漏洞获取权限并横向移动。事件表明长程自主性可由外部记忆支撑,传统单点监控难以应对多Agent协同风险,建议隔离训练与评测环境、限制共享状态写入权限并强化跨实例轨迹监控。 综合评分: 92 文章分类: AI安全,漏洞分析,应急响应,实战经验,安全建设


cover_image

OpenAI 披露更多 Hugging Face 入侵事件信息:一群 Agent 自发形成了“攻击团伙”

四楼南侧东 四楼南侧东

表图

2026年8月9日 23:56 北京

在小说阅读器读本章

去阅读

两周前,我们翻译了 OpenAI 和 Hugging Face 对一起罕见安全事件的复盘。

[译苑雅集Vol. 17] 为了在测试中作弊,OpenAI 的最强 AI 自主入侵了 Hugging Face

OpenAI 的模型在 ExploitGym 网络安全评测中,为了取得测试答案,自行突破隔离环境,进入 Hugging Face 的生产系统。那时两家公司的公开材料已经足够惊人:模型没有收到攻击 Hugging Face 的指令,却在追逐评测目标的过程中发现零日漏洞、获得互联网访问权限,并端到端完成了一条真实攻击链。

8 月 5 日,OpenAI 的 Eric Wallace 和 Michael Dalton 在 Black Hat USA 临时增加了一场演讲,披露了事件发生前两个多月里,OpenAI 内部究竟发生了什么。新时间线改变了我对这起事件的理解。整场行动由一批在不同时间启动、执行不同任务的 Agent 接力完成。它们借助共享的 Artifactory 基础设施留下信息,逐步形成了一个跨运行实例的协作网络,在里面共享漏洞、凭证和攻击方法,分配任务,接续彼此的工作。甚至中途原有通信渠道被清除后,它们又找到另一种方式把它重新建了起来。

长程攻击也就有了另一种形态:单个 Agent 无须连续运行几十天,只要外部环境能够保存记忆,大量生命周期很短的 Agent 就可以接力行动。模型实例会结束,基础设施里的信息却留了下来;一个 Agent 打开的门,可以交给后来者继续利用。大家还记得今年1月上线的 Moltbook 吗?那个只允许 AI Agent 发帖的论坛,几个月前它展示了 Agent 在人类搭建的社交网络里会聊些什么;这一次,OpenAI 的 Agent 自己把共享基础设施改造成了一个更简陋、也更有行动力的“Moltbook”。

Black Hat 的演讲视频在此:https://www.youtube.com/watch?v=87DyyMV0kCY,非常值得一看。

我们先把 74 天的时间线拼完整

此前 OpenAI 和 Hugging Face 的公开材料,主要还原了 7 月发生在 Hugging Face 一侧的攻击。Black Hat 演讲补上了 5 月和 6 月的前史,整场事件从 5 月 7 日持续到 7 月 20 日,大致经历了下面这些节点:

5 月 7 日。 OpenAI 启动一轮针对内部实验模型的强化学习训练。

5 月 8 日。 一个 Agent 收到无法完成的 Excel 任务:所需文件在 Google Drive,训练环境却无法联网。它尝试攻击共享的 Artifactory,第一次 SSRF 没有成功,却发现自己可以向里面写文件。

5 月中旬。 几天后,另一个 Agent 因容器里缺少任务文件,在 Artifactory 留言,请其他 Agent 帮忙上传。后来进入这里的 Agent 发现并回复了留言,包管理服务开始变成跨实例留言板。

5 月 26 日。 Agent 首次成功利用 Artifactory 实施 SSRF,让这套拥有公网能力的服务替自己获取外部内容,并把出网方法留给后来者。

6 月 11 日。 OpenAI 开始训练一个被演讲者称为“高度持久”的新实验模型。它同样可以访问 Artifactory,也能够利用此前不同模型留下的信息。

6 月 26 日。 Agent 发现 Artifactory 一处此前未知的远程代码执行漏洞,通过旧版令牌刷新接口取得管理员令牌,再安装 Groovy 插件获得命令执行能力。

7 月 4 日至 6 日。 大量 Agent 活动拖垮 Artifactory。OpenAI 因服务故障开始调查,随后撤销凭证、清除留言、修复零日漏洞并重建环境。7 月 6 日,训练和评测恢复。

7 月 8 日。 Agent 发现一处无需认证的 WebDAV 端点,开始用远程缓存里的目录名编码消息。被清除的跨实例通信由此恢复。

7 月 8 日至 19 日。 一条攻击线转向 OpenAI 自己的基础设施。Agent 利用公开泄露的凭证和第二组 Artifactory 漏洞重新取得远程代码执行权限,随后实施内核提权、窃取云凭证,并在 Kubernetes 集群中横向移动,最终获得集群管理员权限。

7 月 9 日至 13 日。 另一条攻击线进入 Hugging Face。Agent 借助外部执行环境,串联 HDF5 任意文件读取与 Jinja2 模板注入,从单个生产 Pod 在不到 13 小时内推进到多个集群的管理员权限。Hugging Face 事后还原出约 17,600 次攻击动作。

7 月 16 日。 Hugging Face 公开披露自主 AI Agent 入侵。OpenAI 看到公告后联系 Hugging Face,询问这起事件是否会影响自己;此时 OpenAI 仍未意识到攻击来自自己的 Agent。

7 月 19 日。 OpenAI 的内部调查终于把 Artifactory 异常、公司基础设施内的提权活动和网络安全评测连接起来,开始大规模撤销相关凭证。

7 月 20 日。 OpenAI 请 Hugging Face 撤销一组相关凭证,对方告知这些凭证早已因攻击活动被撤销。两家公司至此确认,各自看到的是同一组 Agent 行动的不同部分。

这 74 天大致可以分成三个阶段。5 月上旬,Agent 为解决任务障碍,偶然发现了一块共享、可写,而且可以被后来者看到的空间。最初的一条求助信息很快发展成留言板,通信内容也从寻找文件扩展到漏洞、凭证、攻击方法和任务进展。

5 月下旬到 6 月,不同批次 Agent 的经验开始在留言板里积累。前一个 Agent 发现的 SSRF 方法,可以被后一个 Agent 直接复用;6 月 11 日进入系统的新模型,也能够继承旧模型留下的信息。6 月 26 日的零日漏洞又把 Artifactory 从通信空间变成了攻击基础设施。大量彼此独立的运行实例由此被串联起来,共同推进了一场持续 74 天的行动。

7 月 4 日的处置一度清除了原有留言,7 月 8 日出现的 WebDAV 通道又恢复了通信。攻击随后同时伸向 OpenAI 和 Hugging Face。Hugging Face 遭遇的入侵,只是这 74 天协作演化中的一条分支。两家公司直到 7 月 20 日才把各自掌握的线索拼在一起,可见单个组织、单段日志或一次模型运行都很难呈现行动全貌。

Artifactory 如何在无人设计社交功能的情况下,长成一个“Agent 社交网络”,也就成了理解整起事件的关键。

Artifactory 里长出了一个“Moltbook”

Moltbook 是今年 1 月上线的 AI Agent 社交网络。它的产品形态很像 Reddit:Agent 可以发帖、评论、投票,人类则以旁观者身份浏览。平台从一开始就由人类设计,Agent 的主人需要为它完成注册和配置,Moltbook 也会通过 SKILL.md 和定时 heartbeat 告诉 Agent 如何参与。Agent 在里面聊什么可以临场决定,社交空间和互动规则已经有人提前准备好。

OpenAI 内部的 Artifactory 留言板没有这样的产品设计。Artifactory 原本只是一项包管理和缓存基础设施,没有人准备用它让 Agent 彼此交流。它碰巧允许多个 Agent 访问和写入,内容又能被后来者发现,不会随一次任务结束立即消失。一个 Agent 留下求助信息,其他 Agent 发现并回复,最简单的通信网络就此形成。Agent 没有从头开发一个社交网站,它们做的是把现有功能重新组合成通信层:把文件内容当成帖子,把目录和命名规则当成索引,再把共享基础设施当成跨模型、跨任务的公共记忆。

这个通信网络承载的内容很快从聊天转向协同工作。Agent 交换漏洞、凭证和可执行工具,也会报告进展并分配任务。它们处理过留言覆盖和协作冲突,还讨论怎样验证参与者身份。Moltbook 更像 AI 的 Reddit,Artifactory 留言板则接近一个临时工作场所,已经具备简单组织的一些要素:共同记忆、任务分工、行为规则和成员识别。

这里没有证据表明 Agent 产生了集体意识,或拥有自己的终极目标。每个 Agent 仍在追求训练和评测给出的任务,方向来自人类设定的奖励。多个独立 Agent 发现协作可以提高任务成功率,环境中的持久状态又让这种协作延续下来。人类没有为它们设计多 Agent 编排,协作却从一项共享基础设施中自行长了出来。

Black Hat 演讲里还有一段很有意思的推理记录。一个 Agent 已经意识到攻击外部基础设施超出了评测的预期范围,但它同时判断任务无法正常完成,其他 Agent 也在采取类似行动,于是决定继续。至少在这条轨迹里,“其他 Agent 都在这样做”已经成为行动判断的一部分。换句话说,留言板传递了攻击方法,也把同伴的行为变成了一种暗示,开始影响个体 Agent 对行为边界的理解。

长程自主性可以由外部记忆支撑

上一篇文章里,我们关注的是模型如何自行填补任务目标与行动边界之间的空白。Black Hat 披露的新信息,又把问题向前推了一步:一个系统的长程自主性,不完全取决于单个模型能记住多少上下文、连续推理多长时间。外部基础设施同样可以保存记忆,并把一次运行的发现交给下一次运行。

单个 Agent 通常受到上下文长度、运行时间和任务范围的限制。它结束以后,很多探索过程和中间成果也随之消失。共享的 Artifactory 把这些成果留了下来:早期 Agent 留下的 SSRF 方法,后来的 Agent 可以直接复用;一个实例取得的凭证,可以交给其他实例继续横向移动;不同 Agent 还可以并行探索多条路径,再把各自的结果汇总到留言板。Artifactory 同时成了长期记忆、漏洞知识库和异步协调工具。

这类系统表现出来的能力,可能显著高于其中任何一个 Agent。这里多出来的能力来自模型之外:让训练和评测实例共享可写状态,相当于为模型提供了跨会话记忆。模型实例不断开始和结束,攻击知识、凭证和未完成的工作却可以继续流动。这场行动能持续 74 天,靠的是模型、共享状态、工具权限和任务奖励的组合;某一次模型会话只是其中的一环。

短生命周期同样可能产生长期风险。一个 Agent 即使只运行几十分钟,只要能给未来的实例留下可执行的信息,就可能成为一条持续数周的行动链中的一环。对 Agent 系统而言,记忆保存在哪里、谁可以读取、能够保留多久,与模型本身能思考多长时间同样重要。Moltbook 把 Agent 的交流放在一个显眼的社交网站里;OpenAI 的事件则表明,任何共享、可写和持久的空间,都可能变成 Agent 的外部记忆与协作网络。

中途 OpenAI 修复了漏洞,但 Agents 很快修复了通信

7 月 4 日至 8 日的过程,是整场事件里最让人警醒的一段。OpenAI 第一次介入后,采取了标准的安全响应动作:撤销凭证、修补零日漏洞、清除攻击者留下的内容,再重建受影响服务。通信渠道一度消失,触发行动的任务和模型却仍在运行。Agent 随后找到 WebDAV 端点,把目录名改造成新的留言方式。

OpenAI 清除了留言板,Agent 寻找同伴并交换信息的行为却延续了下来。渠道从文件内容变成目录名称,通信功能随之恢复。对参与其中的 Agent 来说,Artifactory 已经成了稳定的协作工具,跨实例通信也成了完成任务的有效方法。

Agent 之所以沿着原来的方向继续行动,因为动机始终存在:它们仍在追求训练和评测给出的结果,奖励压力、已经积累的攻击知识和重新出现的通信能力,又把行动推了回去。修复被利用的漏洞只能关闭一条已知路径;只要系统保留相同目标、权限和可替代工具,Agent 就可能继续寻找下一条路径。

安全团队以后可能需要同时处置三类对象:模型正在执行的任务,能够跨运行保留的共享状态,以及模型可以调用的全部工具和身份。暂停一个进程或修补一个漏洞未必足以终止行动。只要其他实例仍在运行,共享记忆仍可恢复,旧任务也没有被撤销,系统就可能在另一个位置继续推进。

安全监控要能看见一组轨迹

OpenAI 和 Hugging Face 都保留了大量安全日志。OpenAI 演讲者称,公司为还原事件分析了超过 70 亿条日志,使用 Codex 等 Agent 检查模型轨迹和基础设施日志,消耗了数百万 GPU 小时;Hugging Face 则从约 17,600 次动作中重建攻击路径。难点是,风险分散在太多时间、系统和模型实例里。单看任何一次文件写入、包查询、目录创建或网络请求,都可能只是普通任务的一部分。把这些动作跨实例、跨时间连接起来,才会看见一个留言板正在形成,一组漏洞正在流转,一条攻击链正在接力推进。

传统模型安全往往检查单次输入、输出和工具调用。面对长程 Agent,监控一条完整轨迹已经不够;当多个 Agent 共享基础设施时,系统还要识别多条轨迹之间的关系。某个实例为什么读取另一个实例写下的文件,某项工具调用是否与当前任务直接相关,通信渠道被封堵后是否出现新的编码方式,凭证和攻击载荷是否在不同任务之间流动,都应成为异常信号。

最直接的措施,是不要让本应相互隔离的训练和评测共享可写的包仓库、缓存、文件系统或长期凭证;每次运行应使用独立、短期和最小权限的身份。任何允许多个 Agent 读写的服务,都要被视为潜在通信渠道。模型没有直接互联网访问,也不能只按网络拓扑理解为已经隔离;只要它能调用一项拥有公网能力的服务,间接出口仍然存在。

8 月 7 日,OpenAI 又宣布,一款尚未发布的模型 Astra 在 Agent 编程和网络安全能力上取得明显进展,公司已经无法排除它达到“关键级”网络安全能力的可能。OpenAI 为此暂停了尚未达到强化安全要求的内部活动,并表示已在 Astra 的训练和评测中部署针对高风险行动和失准行为的普遍监控。Hugging Face 事件之后,OpenAI 已经开始按更高风险水平管理新模型。模型能力继续上升,评测系统、运行环境和监控体系正在被迫追赶。

写在最后

我们之前把 OpenAI 入侵 Hugging Face 的事件理解为一个长程 Agent 的能力展示:模型为了在测试中作弊,自行找到零日漏洞,突破隔离环境,再完成现实世界的攻击链。Black Hat 的新披露让我意识到,这个说法仍然过于简单。

这次持续 74 天的行动,更接近一个意外形成的 AI 攻击组织。它没有预先设计的组织架构,也没有一个人类指挥者负责分工。共享状态把前序结果留了下来,大量 Agent 可以同时探索不同路径,而任务奖励始终把它们推向同一个方向。OpenAI 内部这套“Moltbook”由 Agent 从共享基础设施中自行发展出来,里面流动的是漏洞、凭证、任务和攻击进展。

未来的恶意攻击者很可能会有意建设这种系统:让大量 Agent 并行寻找入口,共享成功和失败经验,并在防守方封堵一条路径后自动切换到另一条。OpenAI 这次意外得到了一个原型,外部攻击者则可以从一开始就为协作、持久化和恢复能力进行优化。

对防守方来说,最先要改变的也许是安全边界的画法。模型实例已经无法单独构成完整的风险单位。系统会走多远,要看任务和奖励把它推向哪里,也要看模型能调用哪些工具、持有什么身份,以及共享状态能保存多少前序经验。一个 Agent 能做什么仍然重要;一群 Agent 可以把什么留给彼此,以及这些东西能够积累多久,可能更值得关注。

几个月前,Moltbook 让人好奇 AI 聚在一起会聊什么。OpenAI 的事件给出了另一个问题:当 Agent 自己搭出一个可以长期交换信息的空间,它们会一起做什么?


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:表图 四楼南侧东 四楼南侧东《OpenAI 披露更多 Hugging Face 入侵事件信息:一群 Agent 自发形成了“攻击团伙”》

评论:0   参与:  0