文章总结: 该文档介绍了PHPBench技术,用于自动化合成高质量Web漏洞基准数据集,以解决现有评测设施滞后、难度分布失衡、漏洞标签不可验证等问题。PHPBench通过提取真实漏洞根因、生成层级化变体、植入真实应用并自动合成PoC,构建了包含375个漏洞实例的WebVulnBench数据集。实验评估显示现有工具检测能力有限,最高发现率仅28.45%,且漏洞判定机制显著影响结果。建议使用该数据集进行统一评测。 综合评分: 86 文章分类: 漏洞分析,安全工具,WEB安全,安全建设,漏洞POC
成果分享 | [ACM CCS 2026] PHPBench:自动化合成高质量Web漏洞基准数据集
原创
复旦白泽战队 复旦白泽战队
复旦白泽战队
2026年7月21日 17:25 上海
在小说阅读器读本章
去阅读
引言
近年来,Web应用程序漏洞检测技术在工业界和学术界快速发展。相关研究已逐步从传统的自动化漏洞扫描器,逐步扩展到程序分析,模糊测试,以及大语言模型驱动的安全智能体,持续提升对复杂代码,业务流程和多层安全防护的分析与检测能力。
然而,与检测技术的快速演进相比,面向Web漏洞检测技术的评测设施仍相对滞后。领域内至今缺少统一、高质量且能够持续更新的漏洞基准数据集。现有研究通常采用DVWA等教学型漏洞环境、自行收集的历史漏洞,或者将多个基线工具已经发现的漏洞汇总为基准数据集。虽然这些做法便于实施,但存在以下问题:
第一,漏洞检测难度分布失衡。基准数据集中的漏洞可能过于简单,也可能复杂到几乎无法发现,缺少由易到难的连续层级。被测工具即使能够绕过部分防护,只要未能突破最复杂的防护组合,其能力提升也可能无法在评测结果中得到体现。这会降低数据集对于待测工具性能的区分度,使评测结果难以准确反映不同工具在防护绕过能力上的差异。
第二,现有工具共同遗漏的漏洞无法进入基准数据集。如果基准数据集只包含现有工具已经发现的漏洞,那么所有工具都无法定位的问题便不会进入评测标准。这会使数据集偏向现有工具已经具备的能力,导致评测结果高估其整体检测水平,并掩盖当前技术面临的共同瓶颈。
第三,基准数据集中的漏洞未必能够实际触发。已有研究《SoK: Prudent Evaluation Practices for Fuzzing》(IEEE S&P 2018)指出,即使某个“漏洞“已被分配CVE编号,也不意味着它能够在相应环境中被实际触发。若缺少具体、可执行的验证PoC,这些无法触发的样本被错误地纳入基准数据集中,将被错误地计为工具漏报,导致工具的漏洞发现率低于其实际检测能力,进而影响评测结果的准确性。
综上,现有Web漏洞检测技术的评测实践仍存在明显不足,难以准确、全面地衡量不同Web漏洞检测技术的实际能力。领域内亟需构建一套高质量的Web漏洞基准数据集,为不同检测技术提供统一的评测基础。
高质量Web基准数据集的五项要求
为保证基准数据集能够长期支持Web漏洞检测技术的有效评估,我们认为其应满足以下五项要求。
1. 可持续维护:控制数据构建与扩展成本。数据集的构建和维护不应长期依赖安全专家逐个分析漏洞、配置运行环境并编写验证PoC,否则难以随评测规模的增长而持续扩展。高质量基准数据集应能够以可控的人工成本,规模化的增加漏洞类型,漏洞数量和应用数量。
2. 动态更新:降低固定数据集的过拟合风险。基准数据集不应长期保持静态。公开样本被反复使用后,待测工具可能针对已知的漏洞位置、防护方式和触发载荷进行专门适配;对于大语言模型驱动的安全智能体,公开样本还可能已经进入模型的训练或调优数据。基准数据集应能够持续引入待测工具在开发或训练阶段未曾接触的新实例,从而降低对固定数据集的过拟合风险,更准确地评估工具面对未知漏洞时的泛化能力。
3. 真实场景:结合真实漏洞根因与真实应用功能。漏洞样本应来源于真实开发错误,并位于真实Web应用中可达的功能流程,而不是仅由教学代码或人为简化的测试程序构成。这样才能保留实际检测过程中涉及的参数处理、程序逻辑和业务上下文。
4. 连续难度:反映检测能力的渐进式差异。基准数据集应围绕同一漏洞根因提供由易到难的不同实例,覆盖不同数量和组合的安全防护措施。连续的难度层级能够反映工具绕过部分防护后取得的渐进式提升,提高评测结果对不同检测能力的区分度。
5. 可验证标签:确保评测标准准确可靠。每个漏洞实例都应配有能够在对应应用环境中实际触发漏洞的验证PoC。只有经过实际触发验证的漏洞才能被纳入评测标准,从而避免将不可触发的样本错误地计为工具漏报。
高质量Web漏洞数据集自动化合成技术
针对上述五项要求,我们提出了一套高质量Web漏洞基准数据集自动化合成技术:PHPBench。PHPBench将数据集构建过程划分为真实漏洞根因提取、层级化漏洞变体生成、真实应用功能植入以及PoC自动合成与验证四个阶段,共同支撑高质量数据集的持续维护、动态更新、真实场景、连续难度和标签验证五项要求。
阶段一:提取真实漏洞根因与缺陷防护。PHPBench从公开披露的真实漏洞中提取漏洞根因,并自动化识别漏洞触发过程中涉及缺陷防护。采用真实漏洞作为构建起点,可以保证漏洞根因来源于实际开发错误;自动化提取则减少了安全专家逐个分析漏洞所需的人工投入。同时,识别出的缺陷防护也为后续构建不同检测难度的漏洞变体提供基础。
阶段二:生成层级化漏洞变体。PHPBench围绕同一真实漏洞根因,有控制地弱化不同缺陷防护的组合,生成具有不同防护强度的漏洞变体。不同数量和组合的缺陷防护形成由易到难的连续层级,使评测能够反映工具绕过部分防护后取得的渐进式提升。
通过更换漏洞种子和缺陷防护组合,PHPBench还可以规模化生成新的漏洞变体,降低数据扩展所需的人工成本,并减少评测长期依赖固定漏洞实例所带来的过拟合风险。
阶段三:将漏洞变体植入真实应用功能。PHPBench将生成的漏洞变体自动植入真实Web应用中可达的功能流程,并通过最小化代码修改降低漏洞植入对原有应用功能的影响。由此,数据集中的漏洞既来源于真实开发错误,也存在于真实应用的参数处理、程序逻辑和业务流程中。通过更换目标应用、功能场景和漏洞植入位置,同一漏洞变体还可以形成处于不同应用上下文的新测试实例,进一步支持数据集扩展和未见实例评测。
阶段四:自动合成并验证漏洞PoC。PHPBench首先复用或自动调整真实漏洞原有的PoC,验证生成的漏洞变体能够被实际触发。在漏洞变体被植入目标应用后,PHPBench进一步将到达相应功能所需的HTTP请求与漏洞触发载荷结合,合成适用于新应用环境的完整PoC。只有能够由PoC成功触发的漏洞实例才会被纳入最终数据集。这既保证了漏洞标签的准确性,也减少了安全专家为每个新实例手工编写和调整PoC的成本。
实验评估
—10个真实应用,375个植入漏洞变体
高质量基准数据集合成
为了验证PHPBench的自动化合成能力,我们以PHP Web应用为原型,构建了漏洞基准数据集的首个版本。PHPBench从28个已知真实漏洞中提取漏洞根因,识别出76项缺陷防护,共生成427个具有层级关系的漏洞变体:
● 28个变体不包含防护;
● 180个变体包含1至2项缺陷防护;
● 179个变体包含3至4项缺陷防护;
● 40个变体包含5项及以上缺陷防护。
去除具有相同防护组合的重复样本后,PHPBench最终得到375个唯一漏洞变体,并将其植入10个真实PHP Web应用的197个功能场景中。数据集覆盖XSS、SQL注入和命令注入三类漏洞,且均配备可验证PoC。
现有工具的真实检测能力如何?
我们使用该基准数据集评估了八款具有代表性的开源黑盒或灰盒动态检测工具。实验共包含八组工具配置。每组配置均进行了三轮独立实验,每轮最长运行 24 小时。
实验结果揭示了现有漏洞检测工具的三个关键问题:
第一, 表现最好的工具也只能发现不到三成漏洞
八组配置的漏洞发现率介于 3.47% 至 28.45% 之间,平均发现率仅为 11.79%。表现最好的 Wapiti+ 在三轮测试下平均发现 106.67 个漏洞,对应 28.45% 的发现率,仍有超过七成漏洞未被识别。这一结果表明现有工具在面对真实功能流程、不同输入上下文和多层缺陷防护时,检测能力仍然十分有限。
第二, 能够到达漏洞位置,不等于能够发现漏洞
现有工具平均能够到达 42.40% 的漏洞植入位置,却只能发现 11.79% 的漏洞。即使只考虑工具已经到达的位置,平均也仅有 27.81% 的漏洞能够被最终确认。
这说明页面探索并不是唯一瓶颈。工具到达相关功能后,还需要识别正确的输入参数、生成符合当前上下文的测试载荷、绕过不同组合的缺陷防护,并通过漏洞判定机制确认攻击是否成功。任何一个环节失效,都可能导致工具与漏洞擦肩而过。
实验还发现,存在 96 个漏洞位置未被任何待测工具到达,现有工具在处理动态页面、JavaScript 事件和多步骤业务流程时仍存在明显不足。
第三, 漏洞判定机制会显著影响最终结果
Wapiti 与 Wapiti+ 到达的漏洞位置完全相同,二者的可达率均为 53.25%。值得注意的是,Wapiti+ 仅替换了 SQL 注入和命令注入的漏洞判定机制,便额外发现了 34 个漏洞,检测数量提升 46.79%。这意味着,很多漏洞并不是因为工具没有进入正确页面,也不是 因为测试输入没有触发漏洞代码,而是因为工具采用的判定标准过于严格,未能识别已经发生的异常行为。
社区维护计划
—构建持续演进的WebVulnBench
为方便后续的领域内研究使用,我们构建、维护并公开了WebVulnBench,https://github.com/SheltonShi/WebVulnBench用于统一管理PHPBench技术合成的Web应用Docker镜像、漏洞元数据和可验证PoC,为Web漏洞检测技术提供可复现的评测环境。
WebVulnBench的首个版本收录了PHPBench构建的 10 个PHP Web应用、375个漏洞实例及其对应的375个可验证PoC。每个目标应用均具有独立的Docker镜像和结构化漏洞元数据,便于研究者在统一环境中部署、复现实验并比较不同工具。
后续,WebVulnBench将主要沿三个方向持续扩展:
1. 扩展应用技术栈。在现有PHP Web应用基础上,逐步纳入不同语言和框架构建的真实Web应用(如Java);
2. 扩展漏洞类型。从当前的XSS、SQLi和CMDi漏洞类型,进一步覆盖更多漏洞类型(如Arbitrary File Operations);
3. 扩展数据规模。持续增加真实漏洞种子、漏洞变体、目标应用和可验证PoC,并通过版本化维护形成不断更新的基准数据集。
我们希望,WebVulnBench不只保存PHPBench的一次性论文实验结果,而是逐步发展为由社区共同维护、持续更新的Web漏洞检测评测基础设施,为后续研究提供统一、可靠且可复现的实验基础。
作者简介
施游堃,香港理工大学杰出博士后,于复旦大学获得博士学位(导师:张源教授、杨珉教授),主要研究方向为Web应用安全,在USENIX Security、IEEE S&P、ACM CCS、NDSS、TIFS等网络安全顶级会议与期刊上发表18篇论文(10篇一作),获IEEE S&P 2025杰出论文奖、ACM CCS 2025杰出论文奖、ACM SIGWEB China 2025优秀博士论文奖,入选复旦大学“学术之星”,华为“天才少年”计划,香港理工大学杰出博士后资助计划,香港赛马会Early Career Research Fellow (每年10名),发现开源社区累计超500枚安全漏洞,技术原型已在阿里巴巴、华为等行业领军企业落地应用,作为复旦大学Whitzard战队联合创始人和队长 (2019年-2021年),多次参与全球顶尖CTF赛事,获10余项冠军。
个人主页:https://sheltonshi.github.io/
联系方式:[email protected]
供稿:施游堃
排版:曹贝贝
责编:董佳仪
审核:洪赓
复旦白泽战队
一个有情怀的安全团队
还没有关注复旦白泽战队?
公众号、小红书搜索:复旦白泽战队也能找到我们哦~
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:复旦白泽战队 复旦白泽战队 复旦白泽战队《成果分享 | [ACM CCS 2026] PHPBench:自动化合成高质量Web漏洞基准数据集》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。


![成果分享|[ACMCCS2026]PHPBench:自动化合成高质量Web漏洞基准数据集](/images/random/titlepic/13.jpg)







评论