文章总结: 本文深度解析GoogleMandiant多智能体漏洞发现框架AVDH,其通过威胁建模、入口发现、上下文增强、假设生成与验证及人工确认六阶段流程,两天发现超100个高危漏洞。核心启示是AI嵌入专家设计流程中,多智能体交叉验证降低误报,人工保留最终裁决权,为国内企业AI代码审计体系建设提供可操作参考。 综合评分: 88 文章分类: AI安全,代码审计,漏洞分析,安全建设,解决方案
两天挖出100+高危漏洞?Google Mandiant多智能体框架AVDH全拆解:这才是AI审计该有的样子
安全牛
2026年9月7日 12:08 北京
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
点击蓝字 关注我们
现实困境:代码越写越快,安全却跟不上了
现在很多中国企业都面临一个尴尬的局面:有了AI辅助,开发团队写代码的速度飞快,但安全审计根本追不上。业务部门催着快速上线,安全团队却人手有限,面对海量代码库和一堆遗留系统,传统的人工审计早就力不从心了。
更麻烦的是,现在的自动化扫描工具虽然跑得快,但误报率高得吓人。安全人员不得不在成千上万条告警里艰难筛选,最后发现真正的漏洞可能就那么几个。时间长了,开发团队对这些工具也产生了”狼来了”效应——即使真有问题也容易被忽略。
Google旗下的Mandiant最近公开了他们内部的一套解决方案,很有参考价值。这不只是个技术demo,而是一套已经运行了约10个月、真实验证过的方法论。
震撼数据:两天发现100多个高危漏洞说明了什么
Mandiant内部运行的这套系统叫AVDH(智能体漏洞发现框架)。在一次真实案例中,针对一个被窃取的企业代码仓库,这套系统两天内就发现了超过100个经过验证的高危漏洞。
这个数字对国内企业特别有警示意义。很多互联网、金融科技、制造业企业的代码规模动辄上百万行,技术栈复杂,历史遗留问题一堆。即便组建一个十人规模的安全团队,想在短时间内完成全面审计也基本不可能。
更值得关注的是,AVDH在这10个月里已经扫描了数千万行代码,产生了数万条发现结果,还在一些常用的Web扩展和开源项目中发现了几十个能拿到CVE编号的漏洞,目前已有12个获得了CVE编号。
但重点不是”AI两天找到100多个漏洞”这个表面数字,而是Mandiant形成的这套完整方法论:AI不是简单替代安全人员,而是被嵌入到一个由专家设计、分阶段执行、相互验证、最终由人确认的完整流程里。
三大痛点:国内企业到底卡在哪儿
痛点一:代码太多,人手太少
源代码审计是个知识密集型活儿。拿到一个陌生代码库,安全人员得先理解系统架构,找到外部输入入口,然后顺着数据流和调用链追踪权限校验、输入过滤、数据处理和敏感操作,最后才能判断一个看起来”可疑”的路径是不是真的有问题。
问题是,现代软件系统规模越来越大。一个漏洞可能涉及多个文件、不同模块甚至不同框架:用户输入在A模块进来,经过B模块转换,在C模块做权限判断,最后在D模块执行数据库查询或系统命令。只看局部片段很容易误判。
国内很多企业早期发展快但不规范,历史代码里积累了大量安全债务。等业务规模起来了、监管要求严了,安全团队才开始系统性回溯审计,这时候面对的往往是千万行级别的代码量,但安全审计人员可能只有个位数。
痛点二:工具误报太多,筛选累死人
传统扫描工具虽然快,但噪声问题一直没解决好。扫描器发现一个”疑似SQL注入”,不代表攻击者真能控制SQL语句;发现一个接口缺少权限判断,也不代表整个调用链上没有其他授权控制。
这直接导致两个问题:第一,安全人员大量时间消耗在误报筛选上,挤压了真正的漏洞研究时间;第二,误报率长期居高不下后,开发团队逐渐产生”警报疲劳”,真实漏洞也可能被忽略。
痛点三:专家经验难以复用
很多国内企业的安全审计高度依赖个别资深专家。这些专家积累了丰富的漏洞识别经验和业务理解,但这些知识存在于个人脑海中,难以标准化、难以传承、更难以规模化复用。
专家离职或团队扩张时,新人得重新经历漫长学习曲线。更要命的是,即使同一家企业的不同代码仓库,审计工作也常常得从零开始。
Mandiant的核心思路:把专家思维流程化
Mandiant构建AVDH时,没有试图造一个”万能AI”,而是把安全专家分析复杂漏洞时的思考过程拆解成多个任务,交给不同AI智能体完成。
整个工作流程分为六个阶段:
- 阶段一:威胁建模——先搞清楚要保护什么
第一步是让AI理解代码库:这是什么类型的软件?主要有哪些模块?哪些代码属于生产环境?哪些目录(比如测试目录)可以不用重点审计?
这一步非常关键。传统工具的常见问题就是不分青红皂白扫描整个代码仓库,虽然能产出大量告警,但很多结果其实没什么实际安全意义。
更重要的是,威胁模型生成后必须由人工审核,然后系统才继续往下走。这说明AVDH从设计之初就没追求”完全无人值守”。人工被安排在一个影响后续分析质量的关键节点——如果威胁模型本身出偏差,后续自动化能力越强反而越危险。
这是第一个重要启示:在AI安全自动化体系中,人工介入最有价值的位置,不是每一步都参与,而是控制那些会影响后续分析边界和判断标准的关键节点。
- 阶段二:入口点发现——建立攻击面地图
完成威胁建模后,AI会扫描分析范围内的每个文件,寻找外部输入进入系统的位置。这些入口可能包括Web路由、API端点、消息队列监听器、进程间通信接口等。
这一步相当于建立应用的攻击面地图。因为大多数可利用的漏洞都要回答一个基本问题:攻击者能控制的数据从哪里进入系统?
一个危险函数本身不一定构成漏洞。如果攻击者无法影响传入的数据,它可能只是理论风险。相反,如果外部可控输入能一路进入敏感操作,且缺少必要的权限控制、过滤或校验,问题才可能演变成真正可利用的漏洞。
- 阶段三:上下文增强——自动补齐分析所需证据
找到入口后,真正困难的工作才刚开始。对于每个入口点,AI会主动收集散落在代码库不同位置、但与安全判断相关的代码,比如权限检查逻辑、输入过滤机制、相关控制代码等。
这一环特别值得借鉴。在人工审计中,研究人员大量时间不是花在”看出某行代码有风险”上,而是花在寻找上下文。看到一个接口要找谁能调用它,看到一个参数要追踪它在哪里被处理,看到一个敏感函数要向前追踪数据来源。
一个真正复杂的漏洞,往往不存在于单独一行代码中,而是隐藏在多个正常逻辑组合后形成的异常安全语义中。
AVDH通过上下文增强,把原本需要安全人员手工完成的”代码追踪工作”交给AI自动执行。它要解决的不只是”AI能不能看懂代码”,而是:能不能自动为下一阶段的安全推理准备足够完整的证据。
- 阶段四:漏洞假设生成——分类专项分析
获得入口和上下文后,AVDH开始进入核心的漏洞假设生成阶段。
这里的设计很有意思。不同AI不是笼统地回答”这里有没有安全漏洞”,而是针对不同漏洞类别分别展开分析。一类AI重点检查访问控制问题(缺失授权、权限提升、CSRF等),另一类重点分析危险数据流(可能导致SQL注入、XSS、命令注入、路径遍历等)。
关键词是”假设”。AVDH不会因为某个AI认为代码存在SQL注入,就立刻把它当漏洞提交。AI生成的只是一个需要进一步证明或推翻的安全假设。
这非常接近成熟安全研究的思维:发现异常 → 建立攻击假设 → 收集证据 → 验证利用条件 → 最终确认漏洞。
- 阶段五:假设验证——让AI主动”互相挑错”
AVDH随后进入假设验证阶段。这是整个系统降低误报率的关键机制。
Mandiant不是只让一个AI验证漏洞,而是让多个AI分别对每个漏洞假设进行判断。而且这些AI被刻意设置了较高的”temperature”参数,目的是扩大不同AI推理结果的多样性——不希望所有AI沿着完全相同的思路得出同样答案,而是希望它们从不同角度审视同一个假设。
然后,再由一个负责综合判断的AI汇总结果,把每个假设划分为:确认、证伪、拒绝三种状态。
这种架构体现了一个非常值得关注的思想:不要只让AI寻找支持漏洞存在的证据,还要让AI主动寻找漏洞不成立的理由。
如果一个AI提出”这里可能存在权限绕过”,其他AI就应该进一步检查:是否存在此前没注意到的权限中间件?是否有统一认证逻辑?攻击者是否真能控制关键参数?数据在到达危险函数前是否已被过滤?相关代码路径是否实际可达?
只有经过”提出假设—挑战假设—综合判断”的过程,结果才会继续向下游传递。
- 阶段六:人工验证——AI确认不等于漏洞确认
AVDH最值得强调的一点,恰恰是它没有把AI放在最终裁决者的位置。
即使一个漏洞已被多个AI判断为”确认”,它依然不能直接成为最终结论。每个确认结果最终都必须交给Mandiant的人工安全专家实际复现攻击、运行PoC代码,确认两个核心问题:第一,漏洞是否真实存在;第二,是否存在此前没发现的安全控制,使得攻击实际无法完成。
如果人工验证失败,该发现就会被丢弃。
这也是Mandiant明确强调的建议:考虑部署类似框架的防守团队,应当对发现结果进行人工验证。
更准确地说,这是一个AI负责扩大分析规模、收集上下文、生成安全假设并多轮验证,人类专家负责最终事实确认的Human-in-the-loop漏洞发现体系。
关键能力支撑:如何证明AI真的”会”找漏洞
还有一个容易被忽视但极为关键的问题:如何证明AI真的具备漏洞发现能力,而不只是记住了训练数据中的漏洞案例?
如果拿公开漏洞数据库测试模型,模型准确发现了其中的漏洞,这能证明它有能力吗?不一定。因为当前大模型可能在训练时就接触过公开漏洞数据。模型给出的正确答案究竟来自真正的代码推理,还是来自对训练数据的”记忆”,很难判断。
Mandiant因此构建了人工合成、故意包含漏洞的代码库,目的就是降低数据污染对测试结果的影响。
对准备建设企业内部AI安全评估体系的中国企业来说,这是一项值得参考的最佳实践:评估AI安全能力时,不能只测试”它知不知道已经公开的答案”,而应该测试”面对此前没见过的问题,它能不能根据代码本身推理出答案”。
此外,Mandiant还强调了专家规则的重要性。AVDH在验证阶段会结合安全顾问编写的规则进行判断。这些规则按照软件领域组织,进一步划分为编程语言、框架、漏洞类型三个维度。
这种设计的价值在于知识复用。按语言、框架和漏洞类型组织安全知识,可以让相同经验迁移到不同代码库中。
从安全工程角度看,这实际上是在尝试把安全研究员长期积累的经验,从”存在于人的脑海中”,逐渐转化为可以被AI工作流持续调用的结构化知识和判断规则。
给中国企业的六条实践建议
把Mandiant的AVDH架构抽象成可参考的方法论,可以总结出六个关键原则:
第一,把漏洞发现设计成流水线,而不是一个Prompt。不要期待把整个代码仓库交给模型,询问”请找出所有漏洞”就能获得稳定结果。更可行的方法是将复杂任务拆分成威胁建模、入口发现、上下文增强、假设生成、假设验证和人工确认等多个阶段。
第二,先理解攻击面,再寻找漏洞。漏洞不是孤立的危险代码。识别外部输入入口、权限边界和数据流,是判断漏洞能否真正形成的重要基础。特别是对于采用微服务、前后端分离架构的国内企业,攻击面复杂度远超传统单体应用。
第三,让AI验证AI,而不是相信第一次输出。多个AI从不同角度审查同一个漏洞假设,再通过综合AI形成结论,是降低噪声的重要机制。”模型给出了答案”不应该等同于”事实已经确认”。
第四,把专家知识写进框架,而不是只依赖模型自身知识。真正形成竞争力的可能不是某个基础模型,而是:基础模型 + 专家规则 + 工作流设计 + 验证机制。内部安全团队长期积累的代码规范、漏洞案例、架构知识和审计经验,都可能成为未来智能体安全系统的重要资产。
第五,高风险结论必须保留人工验证。AVDH已经通过多个AI阶段过滤结果,但Mandiant依然要求专家复现漏洞并执行PoC。在漏洞确认这种高影响场景中,AI适合大幅压缩分析范围、提升发现效率,但最终结论仍然需要事实验证。
第六,建立能够避免”训练集污染”的评测体系。如果评测数据已广泛公开,模型可能通过记忆获得漂亮成绩。企业想知道自己的AI代码审计系统到底有多强,就需要构建更接近真实未知漏洞的内部测试集。
重新定义问题:不是”要不要用AI”,而是”如何重构安全生产线”
Mandiant研究人员指出,保护软件开发流水线已成为现代企业防御的重要挑战。AI正在提高软件生产效率,同样也可能提高攻击者分析代码、发现缺陷和寻找攻击路径的效率。如果进攻方能借助AI扩大漏洞研究规模,而防守方仍完全依赖人工逐行审计,攻防两侧的效率差距就可能持续扩大。
对中国企业安全负责人而言,问题可能需要从”我们要不要部署一个AI代码扫描器?”转变成:”我们能不能把现有的安全审计方法拆解成AI可以执行、AI之间可以互相验证、最终由人类专家确认的安全工作流?”
两种问题看起来相似,实际代表着完全不同的建设思路。前者关注一个工具,后者关注一套新的安全生产体系。
从国内企业实际情况看,后者可能更符合现实需求。许多企业并不缺少安全工具,而是缺少能够将工具能力、人员经验和业务场景有效整合的体系化方案。
结论:AI不会自动解决漏洞问题,但能重新定义安全审计效率
AVDH案例最值得关注的地方,不是AI”取代”了多少安全人员。从流程看,人类专家不仅没消失,反而被放到了更关键的位置:威胁模型需要人工审核,验证规则来自顾问的经验,最终漏洞还必须由专业人员复现并通过PoC确认。
真正发生变化的,是人的时间被重新分配了。过去安全人员需要花大量时间浏览文件、寻找入口、追踪调用关系、收集上下文并筛选大量疑似问题。在多智能体体系下,这些高度消耗时间、同时又具备一定结构化特征的工作,可以被大规模自动化。
安全专家则将更多精力投入真正需要经验和判断力的环节——定义安全边界、设计检测逻辑、判断漏洞是否可利用,以及最终确认风险。
这或许是AVDH给中国企业安全行业最有价值的启示:AI时代的代码安全竞争,不只是模型能力的竞争,更是安全知识工程化能力、工作流设计能力和验证体系的竞争。
如果一个组织能够把专家经验沉淀成规则,把复杂安全任务拆解成智能体可以执行的步骤,再通过多智能体交叉验证和Human-in-the-loop机制控制结果质量,那么AI就不再只是一个”会回答安全问题的聊天机器人”,而是成为安全工程体系中的一个规模化执行层。
从Mandiant已披露的实践看,这种变化不是遥远设想:AVDH已运行约10个月,扫描数千万行代码,产生数万条发现结果,并在实际调查、Web扩展和开源项目中发现了一批经过验证的安全问题。
对于正在建设DevSecOps、代码安全审计以及AI安全能力的中国企业来说,接下来值得思考的或许已不是”AI能不能挖漏洞”,而是三个更现实的问题:
- 哪些安全分析工作可以交给AI规模化执行?
- 哪些专家经验能够被固化成机器可调用的规则和工作流?
- 当AI给出一个看起来非常可信的漏洞结论时,我们是否建立了足够可靠的机制,证明它真的成立?
这才是从”使用AI做安全”,走向”建立AI时代安全工程体系”的关键一步。
相关阅读
《AI驱动的SDLC及软件供应链安全技术应用指南》重磅发布
被欧盟AI法案罚掉全球营收的3%?网安人现在就得干掉这“三个不知道”
利用自动化渗透测试实现常态自动化网络安全验证
联系我们
合作电话:18610811242
合作微信:aqniu001
联系邮箱:[email protected]
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全牛 《两天挖出100+高危漏洞?Google Mandiant多智能体框架AVDH全拆解:这才是AI审计该有的样子》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论