白泽AI威胁情报|一个模型,两个版本,三次泄露,全球封停

admin 2026-07-28 04:33:06 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文由复旦白泽战队发布,梳理了AnthropicClaudeMythos模型从发布、泄露到全球封停的事件。核心要点是:Mythos能力快速增强,但Anthropic将其拆分为Fable和Mythos两个版本,后者仅限可信机构。随后发生内部资产暴露、Fable越狱及大规模模型蒸馏等泄露事件。美国政府为控制能力流向,最终导致模型全球封停,并按权限分层重启。事件表明,当模型能力成为战略资源,其发布与使用将受政府严格管制。 综合评分: 87 文章分类: AI安全,威胁情报,漏洞分析,安全意识,政策法规


cover_image

白泽AI威胁情报|一个模型,两个版本,三次泄露,全球封停

原创

复旦白泽战队 复旦白泽战队

复旦白泽战队

2026年7月27日 17:16 上海

在小说阅读器读本章

去阅读

本文由 白泽 AI 威胁情报平台 整理发布:https://whitzard-intelligence.tech/


CLAUDE MYTHOS事件梳理 · 白泽AI威胁情报中心

模型越来越强,美国开始决定谁能先用最强AI。当模型能力本身成为战略资源以后,一个模型何时发布、向谁发布,将不再只由模型公司决定。

        6月9日,Anthropic同时发布了两个模型。一个叫Claude Fable 5,面向公众开放。另一个叫Claude Mythos 5,只允许少数经过审核的机构使用。但它们其实是同一个底层模型。两者的主要差别在安全护栏:Fable外面套着严格的安全分类器;Mythos则解除部分限制,可以完整使用它最危险、也最有价值的网络安全能力。

    3天后,美国政府突然要求所有外国民众停止访问两个模型。Anthropic无法核验全球用户国籍,只能将它们全部关闭。一个刚上线4天的旗舰模型,就这样全球下线。19天后,Fable 5重新向全球开放;Mythos 5却只恢复给少数获得批准的美国机构。

    如果只看新闻,这像是一连串混乱的发布、泄露和政策反转。但把过去一年放在一起,其实始终围绕着三件事

THE FIRST THING

第一件事:Mythos能力快速增强,开放范围逐步扩大

2026.04.07

Mythos第一次正式出现

Anthropic没有像发布普通Claude那样直接开放,而是推出Claude Mythos Preview,并启动Project Glasswing,只让少数网络安全机构和关键基础设施提供商使用。

原因很简单:它的网络安全能力跨过了一条线。

Anthropic称,Mythos不仅能发现软件漏洞,还能完成侦察、漏洞利用、权限提升和横向移动等一连串任务。它在部分网络攻防工作上已经超过绝大多数人类安全专家。

Glasswing首月,合作机构使用Mythos扫描出超过23000个漏洞,其中6200多个被标记为高危;Firefox在一次版本更新中集中修复了271个相关问题。但发现速度远远超过修复速度,实际修复比例不足1%

Mythos越强,它的两面性也越明显:同一种能力可以替防守者找到漏洞,也可以帮助攻击者更快找到入口。

2026.06.09

同一个模型,被拆成两个名字

Anthropic不再满足于小范围测试。它让Mythos 5保留更完整的能力,继续交给Anthropic的可信机构;同时Fable 5加上安全分类器,第一次把Mythos级别的通用能力交给公众。

Anthropic公布的测试显示,这个模型已经能够长时间独立完成复杂工作:

  • 在一个拥有5000万行代码的项目中,用一天完成全代码库迁移;
  • 在药物设计测试中,将部分流程加速约10倍;
  • 用一周多时间整理覆盖138种动物、数百万个细胞的数据,并训练新的识别模型。

这些结果主要来自Anthropic和合作机构自述,仍需要更多独立验证。但能力向外下沉的趋势已经很清楚。

2026.06.30

能力继续向普通用户下沉

能力接近上一代Opus的Sonnet 5成为免费用户默认模型;同一天上线的Claude Science,又把模型、科研数据库、专业工具和计算集群装进一个工作台。

今天只向少数机构开放的能力,几个月后就可能被包装进更便宜、用户更多的产品。

Mythos的能力在快速增长,而商业压力又推动Anthropic不断把这些能力向外发布。

THE SECOND THING

第二件事:能力还没完全开放,泄露和蒸馏已经开始了

这里说的“泄露”,其实包含三层逐级升级的风险

 从看见内部产品,到绕过安全护栏,最后发展为复制模型能力。

01产品暴露

内部资产、源代码、入口和系统提示词被看见

02护栏绕过通过越狱释放本应只属于Mythos的能力

03能力复制通过数千万次调用蒸馏模型能力

2026.03.26—04.07

发布前,内部产品信息连续暴露

3月26日,安全研究人员发现约3000份Anthropic内部资产意外公开。“Claude Mythos”这个代号第一次出现在公众面前,文件还提到其“前所未有的网络安全风险”。

3月31日,Claude Code约50万行源代码被意外打包进公开的npm发布包。

4月7日,Discord用户又通过猜测URL规律,利用旧账号进入未公开的测试后台。

Fable 5发布后,系统提示词也很快被公开。

这些事件暴露了Anthropic的内部管理和产品结构,却不等于模型核心能力已经被偷走。

2026.06.12

Fable 越狱触发全球封停

Fable与Mythos使用同一个底层模型。Fable之所以能对公众开放,是因为安全分类器会拦截网络攻击、生物研究和模型蒸馏等高风险请求。只要有人绕过分类器,就可能让Fable释放本应只属于Mythos的能力。

6月12日全球封停的直接导火索,正是一份Fable 5越狱报告。报告显示,研究人员绕过分类器后,让模型识别软件漏洞,并在一个案例中生成漏洞利用代码。

后续测试认为,那次绕过没有释放Mythos独有能力;Anthropic更新分类器后,称可以在超过99%的测试中拦截相关方法。但Anthropic也承认,目前很可能不存在永远无法越狱的模型。

2026.02.23—06.24

数千万次调用开始蒸馏能力

蒸馏不需要偷走模型参数。只要使用大量账号反复向模型提问,持续收集它的推理、编程和工具调用结果,就可能把这些能力变成另一套模型的训练数据。

2月到6月,Anthropic曾多次公开指控其他AI厂商通过大量虚假账号对Claude进行大规模蒸馏,涉及数千万次交互。而在5月,大量用户也发现Claude在对话中会突然自称为其他模型,或复现其他开源模型的典型输出风格。这些争议的真假暂且不论,它们共同指向同一个问题:模型能力一旦通过API开放,就可以被高频调用、低成本复制,流向无法追踪,边界难以划定。

从内部资产暴露,到护栏被绕过,再到数千万次调用蒸馏能力,风险一层比一层更接近Mythos本身。

Anthropic还在研究如何安全发布Mythos,外界已经在研究如何进入它、绕过它和蒸馏它。

THE THIRD THING

第三件事:美国既想使用Mythos,也想控制它流向哪里

2025.07—2026.02.27

从 2 亿美元合同到彻底决裂

2025年7月,Anthropic与美国国防部签下最高2亿美元合同,Claude开始进入军方系统。合同中保留两条红线:不得用于自主武器,不得用于大规模国内监控。

2026年2月27日,双方谈判彻底破裂。五角大楼要求Anthropic接受Claude可用于“所有合法用途”,这可能覆盖Anthropic明确反对的场景。Anthropic拒绝后,被美国政府定性为“供应链风险”,随后走向法庭。

但与此同时,美国政府和安全机构又希望继续使用Claude发现漏洞、保护关键基础设施。表面上,这是“一边拉黑,一边使用”。但如果把Mythos看作战略能力,逻辑就很清楚:

对内,它是一件必须尽快部署的工具;对外,它是一种不能无条件扩散的能力。

2026.06.02

政府开始提前看模型

美国签署前沿AI安全行政令,要求建立机密模型能力测试。指定政府机构可以在模型向其他合作伙伴发布前,最多提前30天获得访问;政府还将参与选择哪些可信机构可以优先使用模型。

2026.06.12

外国人禁令变成全球关停

Fable越狱报告触发外国国民访问禁令。政府要求所有外国国民停止访问Fable 5和Mythos 5,包括身在美国的外国人以及Anthropic自己的外籍员工。

政府针对的是外国人,最终结果却是全球关停,因为Anthropic无法实时判断每一个账号背后的真实国籍。

2026.06.26—07.02

19 天后,按权限分层重启

6月26日,部分美国机构获准恢复使用Mythos 5。

7月1日,带有强护栏的Fable 5恢复全球开放;限制更少的Mythos 5,仍只向少数获批机构恢复。

7月2日,Anthropic公布新的越狱严重度框架,并承诺与美国政府加强发布前测试、重大漏洞通报和联合研究。最终形成了分层处理:

  • 普通用户得到带护栏的Fable;
  • Anthropic的可信机构得到更完整的Mythos;
  • 美国政府提前看到下一代模型,并参与决定能力如何放行。

美国真正在意的,是最前沿、最少护栏的Mythos能力先交到谁手里。普通用户能否与Claude聊天,并不是控制的核心。

把三件事放在一起看

随着Mythos能力增强,Anthropic面临更强的商业动力,需要逐步扩大它的服务范围。

能力越快向外流动,越狱和蒸馏就越有价值。

而能力越可能被绕过和复制,美国政府就越希望介入发布顺序。

能力增长

推动开放

引来政府管制

过去,出口管制主要控制芯片、设备和源代码。

Mythos带来了一个更难处理的对象:可以通过API被调用、通过越狱被释放、通过蒸馏被复制的模型和服务。

只要模型开始服务,能力就已经开始流动。

这才是Claude Mythos最值得关注的地方。

当模型能力本身成为战略资源以后,一个模型何时发布、向谁发布,将不再只由模型公司决定。

作者介绍

洪赓

复旦大学网络战略研究所副所长,聚焦AI安全治理等前沿方向,在 IEEE S&P、USENIX Security、NDSS 等顶级学术会议发表论文二十余篇,获 NDSS 2026 最佳论文奖、上海市技术发明一等奖等荣誉。个人主页 » https://ghong.site/

刘淇

复旦大学计算与智能创新学院25级直博生。本科毕业于复旦大学信息安全专业,主要研究方向为网络黑灰产检测与人工智能安全治理。

张赫

复旦大学计算与智能创新学院26级直博生。本科毕业于武汉大学软件工程专业。主要研究方向为人工智能安全治理。

雒启轩

复旦大学管理学院2025级本科生。

张凌尔

复旦大学计算与智能创新学院2025级本科生(香农计划)。

供稿、排版:刘淇

责编:董佳仪

审核:洪赓

复旦白泽战队

一个有情怀的安全团队

还没有关注复旦白泽战队?

公众号、小红书搜索:复旦白泽战队也能找到我们哦~


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:复旦白泽战队 复旦白泽战队 复旦白泽战队《白泽AI威胁情报|一个模型,两个版本,三次泄露,全球封停》

评论:0   参与:  0