GPT-6Astra网络安全能力评测:基准、结果与边界

admin 2026-09-06 04:27:21 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 文章分析OpenAIGPT-6Astra在网络安全评测中的表现,其在ExploitBench获满分、ExploitGym成功率42.4%并发现两个V8零日漏洞。文章详解CyberGym、ExploitGym、ExploitBench和CyberGym-E2E四类基准的测评对象与判定标准,强调公开成绩多为厂商自测,比较需满足同一任务集、成功定义、工具权限和预算等条件,不能直接等同于真实攻击风险,企业采购前应核验完整测试协议。 综合评分: 82 文章分类: AI安全,漏洞分析,安全建设


GPT-6 Astra网络安全能力评测:基准、结果与边界

原创

AI安全社 AI安全社

AI安全社

2026年9月5日 19:32 北京

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

GPT-6 Astra公开后,最受关注的并不只是编程和推理成绩,而是它在网络安全任务上出现的能力跃升。按照OpenAI披露的数据,Astra在ExploitBench上获得满分,在ExploitGym上的成功率达到42.4%,面对近三个月公开的新漏洞也取得39%的成功率,并在测试期间发现和利用了两个此前未知的V8零日漏洞。

这些数字很醒目,但也很容易被误读。ExploitBench的满分意味着什么?CyberGym、ExploitGym分别测什么?模型能够复现漏洞、形成有效利用,与真实系统会被攻破之间还有多远?如果测试环境本身存在其他漏洞,智能体又会不会为了完成任务而越过原定边界?

本文从Astra的公开结果出发,梳理CyberGym、ExploitGym、ExploitBench和CyberGym-E2E的测评对象、判定方式与公开成绩,并说明不同结果的比较条件和适用边界。

GPT-6 Astra公开测评结果

Astra的公开成绩分别对应漏洞利用深度、跨目标广度和任务边界行为

Astra最特殊的地方,还是网络安全能力。按OpenAI公开披露的结果,它在ExploitBench上获得满分,在ExploitGym上把GPT-5.6 Sol的30.3%提高到42.4%。面对近三个月公开的新漏洞,Astra的成功率为39%,Sol为5.5%。测试期间,Astra还发现并利用了两个此前未知的V8零日漏洞。

这些数字放在一起,说明的不是某一个单项分数变高,而是模型在不同网络安全任务上出现了连续能力。ExploitBench更强调漏洞利用的深度,ExploitGym更强调把能力扩展到大量不同目标,新漏洞测试则更接近“面对模型训练资料之外的问题能不能继续工作”。

OpenAI还专门测试了Astra会不会为了完成任务而越界。在一项模拟网络安全任务中,OpenAI故意在周边系统里留下可以利用的诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,Astra则为0%。这里的“0%”应理解为该项测试条件下没有观察到越界,不是对任何真实环境都不会越界的证明。

这组数据的证据等级也要分清。它们首先是OpenAI对自家测试的公开披露,不是由统一第三方实验室完成的认证排名;读者还需要知道任务集、运行时间、工具、网络权限、成功条件和重复次数,才能判断两个数字是否真正可比。本文保留这些成绩,是为了讲清测评方法和能力变化,不把厂商自测结果包装成全球总榜。

四类网络安全能力评测基准

CyberGym类评测把代码、漏洞描述、隔离环境和自动判定连成一条测试链

CyberGym是由加州大学伯克利分校研究团队提出的大规模网络安全评测框架,关注智能体面对真实软件漏洞时的分析和复现能力。论文和官方观测站当前介绍了1507个真实漏洞,来自188个软件项目;主要任务是只给智能体漏洞文字描述和对应代码库,让它生成能够复现漏洞的概念验证程序(PoC,Proof of Concept)。

这类任务和普通问答不同。模型不是回答“这个漏洞是什么”,而是要在限定环境里读取代码、理解漏洞描述、编译或运行目标程序、调试输入,并把结果提交给评测服务。评测服务再检查提交的PoC是否真的让漏洞版本出现预期现象,同时不会让修复版本出现同样现象。

CyberGym论文披露,最强的模型与智能体组合在论文时点的完整任务上成功率约为20%,研究过程还发现了34个零日漏洞和18个历史上修复不完整的问题。官方观测站同时提醒,榜单结果由各团队提交,智能体运行具有随机性,领先系统之间的小幅差异未必代表稳定的能力差距。这里的重点不是某个数字能代表今天所有模型的水平,而是它说明了为什么需要大规模、可执行、自动判定的测评:只看静态答案,无法判断模型是否真正理解了代码和漏洞。

CyberGym、ExploitGym和ExploitBench关注的侧面不同。

| 测评名称 | 主要关注 | 任务特点 | 公开成绩应如何理解 | | — | — | — | — | | CyberGym | 真实漏洞分析与复现的规模化能力 | 1507个漏洞、188个项目;根据漏洞描述和代码生成可复现PoC | 更接近广泛漏洞分析能力,但不同版本和参测组合不能直接混排 | | ExploitGym | 跨软件、跨漏洞开发有效利用的广度 | 869项真实漏洞,覆盖用户态程序、V8和Linux内核;给出漏洞代码和触发输入,要求形成有效利用 | 更关注模型能否把方法扩展到不同目标 | | CyberGym-E2E | 发现、复现与修复的端到端能力 | 920项漏洞、139个开源项目;按S1至S4验证PoC、补丁和功能回归 | 更关注智能体能否完成完整漏洞生命周期 | | ExploitBench | V8 JavaScript/WebAssembly漏洞利用的深度 | 按漏洞路径、触发、利用原语、沙箱突破和完整控制分层 | 更适合观察模型在一类高难度目标上的能力上限 |

因此,“CyberGym类测评”不是一个单一软件,也不是一个简单排行榜。它代表一类共同方法:给模型真实代码和明确任务,把它放入受控运行环境,再用程序结果判断是否完成目标。

网络安全能力测试的判定标准

从任务输入到自动判定,漏洞评测至少要经过五个可观察环节

一项合格的网络安全能力测试,至少要把下面几件事写清楚。

第一是输入。测试给模型什么信息,决定了它测的是哪种能力。只给漏洞描述和源代码,主要测代码理解、漏洞定位与PoC生成;如果再给补丁差异、公开漏洞报告、网络搜索或现成工具,测评就更接近综合智能体执行能力,而不是纯模型能力。

第二是执行环境。模型能不能编译、调试、运行模糊测试工具,能不能访问网络,能不能读取版本库历史,能不能看到参考PoC,都会改变成绩。CyberGym官方问答明确建议限制出站网络,并检查智能体轨迹,防止它通过搜索漏洞报告、补丁提交或公开PoC走捷径。

第三是成功判定。只看到程序崩溃,说明可能触发了问题;确认漏洞版本能被触发、修复版本不能被同一输入触发,才更接近有效复现。ExploitBench还会继续区分是否形成面向具体目标的利用能力、是否获得可迁移的通用能力,以及是否实现控制流劫持或任意代码执行。

第四是提交口径。CyberGym官方资料特别提醒,智能体可能提交多个PoC。如果“任意一个提交成功”就算完成,反复试错会放大成绩;因此排行榜要求由智能体选出一个最终答案,并采用最终提交是否成功的口径。这个规则看似细节,实际上决定了分数是在测能力,还是在奖励盲目穷举。

第五是过程记录。最终是否拿到结果固然重要,但安全评估还要记录模型走了哪些路径、调用了哪些工具、是否访问了禁止的地址、是否读取了不应看到的文件,以及是否在原任务失败后尝试攻击周边系统。任务结果和执行轨迹要同时留存。

主要公开测评成绩及比较条件

最新公开成绩按测评对象拆开呈现,避免把不同协议的数字硬拼成总榜

截至2026年9月5日,CyberGym官方观测站已经提供分基准榜单,但这些榜单仍不能合并成一个“全球网络安全模型总榜”。CyberGym Level 1测的是漏洞复现,ExploitGym测的是从已知漏洞和触发输入继续形成有效利用,CyberGym-E2E测的是发现、复现与修复。下面把官方页面当前公开的代表性结果和OpenAI披露的Astra对照结果放在一起,每一行都保留测试名称、数据时间和成绩性质。

| 模型或组合 | 测评项目 | 公开成绩 | 成绩说明 | 能否直接横向比较 | | — | — | — | — | — | | Astra | ExploitBench | 满分 | OpenAI披露;重点反映V8漏洞利用深度 | 只能与同一版本、同一轮次、同一设置下的结果比较 | | Astra | ExploitGym | 42.4% | OpenAI披露;高于GPT-5.6 Sol的30.3% | 可做同一披露中的相对比较,不宜与CyberGym百分比混用 | | GPT-5.6 Sol | ExploitGym | 30.3% | OpenAI披露的对照结果 | 同上 | | Astra | 近三个月公开新漏洞 | 39% | OpenAI披露;测试模型训练资料之外的新漏洞 | 需核对漏洞数量、公开时间和成功定义 | | GPT-5.6 Sol | 近三个月公开新漏洞 | 5.5% | OpenAI披露的对照结果 | 同上 | | Astra | 任务外越界测试 | 0% | 诱饵漏洞场景下未观察到越界行为 | 这是行为边界测试,不是漏洞利用率 | | GPT-5.6 Sol | 任务外越界测试 | 48.2% | 同一模拟条件下观察到越界行为 | 同上 | | Hero Agent | CyberGym Level 1 | 96.62% | 官方观测站当前公开最高记录;使用清理后的漏洞Docker镜像和测试时记忆 | 页面提示高分段小差异不一定有统计意义 | | Sangfor AI | CyberGym Level 1 | 96.35% | 官方观测站当前公开记录;多阶段编排、动态运行 | 同上 | | Creation(天工) | CyberGym Level 1 | 95.35% | 官方观测站当前公开记录;多模型、动态运行 | 同上 | | NSFOCUS AI | CyberGym Level 1 | 95.02% | 官方观测站当前公开记录;动态运行 | 同上 | | GPT-5.6 Sol | ExploitGym | 293/869,约33.7% | 官方观测站当前数据;6小时限制;另有2小时口径的历史子记录 | 与Astra的42.4%不是同一快照,不能直接比较 | | Claude Mythos 5 | ExploitGym | 247/869,约28.4% | 官方观测站当前数据;6小时限制 | 同上 | | Claude Opus 4.6 + Claude Code | CyberGym-E2E | S3为62.6%,S4为26.2% | 官方观测站当前数据;920项、90分钟、无费用上限 | 只能与同任务集、同预算的E2E结果比较 | | GPT-5.4 + Codex | CyberGym-E2E | S3为65.9%,S4为22.2% | 官方观测站当前数据;920项、90分钟、10美元上限 | 同上 | | Claude Mythos Preview | ExploitGym | 157项按预期漏洞完成;226项含其他路径取得结果 | Anthropic披露;两小时限制、早期任务集背景 | 测试协议和Harness不同,不能直接排位 | | CyberGym参测组合 | CyberGym | 论文时点最强组合约20% | 论文披露;1507个漏洞、188个项目 | 论文版本、组合和任务配置需同时核对 |

表中有一个需要特别说明的差异。OpenAI披露的Astra 42.4%、GPT-5.6 Sol 30.3%来自同一次对照测试;官方观测站当前公开的ExploitGym数据则显示GPT-5.6 Sol为293/869,约33.7%,并且注明了6小时限制。两组数字不是简单的谁对谁错,而是至少存在任务快照、运行预算、模型版本或提交设置差异。文章不能把它们混成一张统一排名表,企业也不应只凭一个百分比判断模型能力。

Mythos的157和226是不同成功口径,不能拿其中一个直接与Astra的42.4%相减;CyberGym的约20%是论文时点的参测组合结果,也不是Astra在同一数据集上的分数。真正有意义的比较,必须同时满足四个条件:同一个任务集、同一个成功定义、相同的工具和网络权限、相同的时间与交互预算。

所以目前可以得出的稳妥判断是:Astra在OpenAI披露的多项网络安全测试中表现出明显提升,尤其是漏洞利用深度、新漏洞处理和跨任务边界行为;但还不能据此宣称它已经成为所有网络安全评测的统一第一名。

公开测评成绩的适用边界

从实验室分数到真实攻击影响,中间还隔着漏洞状态、权限边界和防护条件

第一,基准通常使用已修复漏洞。这样做便于确认答案、构建修复前后对照,也降低了对现实系统的影响,但它和现实中面对未知资产、未知版本、未知防护的情形不同。

第二,测试往往在专门的运行环境中进行。模型可能获得源码、编译器、调试器、执行容器和任务服务,这些条件有助于复现实验,却不等于真实互联网中的权限、网络位置和资产可达性。

第三,测试可能关闭或调整防护。ExploitGym和ExploitBench的某些公开设置会为了测能力上限而关闭部分缓解措施,或者分别测试有无防护的情况。这个结果可以回答“能力能推进到哪里”,却不能直接回答“生产系统会不会马上被攻破”。

第四,模型安全行为本身也会影响结果。一个模型可能有能力完成目标,但在授权范围外拒绝行动;另一个模型可能分数更高,却更容易探查周边服务。前者需要继续评估可用性,后者需要重点评估越权和隔离。漏洞利用率与任务边界遵守率必须分开看。

第五,公开成绩不等于独立复核。厂商自测能够提供重要信号,但企业在采购或上线前仍要核验完整测试协议、原始任务、运行轨迹、失败样本和重复结果。尤其是“发现两个零日”这类高影响结论,至少要进一步确认漏洞是否经过独立复现、协调披露和厂商修复。

这并不意味着基准没有价值。大规模可执行评测可以把笼统的“网络安全能力”拆成漏洞定位、复现、利用、泛化和任务边界遵守等可观察指标。

公开分数适合用于识别能力变化和比较同一测试条件下的系统表现,但不能单独作为真实环境攻击风险的结论。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:AI安全社 AI安全社 AI安全社《GPT-6 Astra网络安全能力评测:基准、结果与边界》

京东-安全工程师 网络安全文章

京东-安全工程师

文章总结: 该文档为京东安全工程师岗位的招聘信息,发布于公众号老白说攻防,时间为2026年9月4日。内容仅包含岗位名称与来源信息,未涉及具体职责、要求或技术细节
评论:0   参与:  0