VERTFuzz:用 Transformer 重塑复杂文件解析器模糊测试

📅 2026/8/10 12:05:19
VERTFuzz:用 Transformer 重塑复杂文件解析器模糊测试
“ 针对复杂文件格式如 PDF / ELF / XML / TIFF的漏洞挖掘一直是模糊测试领域的“硬骨头”。传统 Fuzzer如 AFL / AFL普遍存在三大问题难以生成符合格式规范的输入大量测试样本被解析器直接拒绝随机变异难以触及深层语义逻辑路径输入空间稀疏导致有效漏洞触发概率极低。为了解决这些问题论文提出VERTFuzz基于 Version Transformer 的结构感知模糊测试框架让Fuzzer理解文件结构并生成“高质量、可执行、有效”的测试样本。 ”论文标题VERTFuzz: Version transformer-driven fuzzing for complex file parsers发表时间Computers Security2025作者单位北京电子科技学院 开源代码https://github.com/yaoxixixi/VERTFuzz01—方法介绍VERTFuzz 的关键 insight 在于相比随机修改文件内容修改 metadata 更容易触发新的执行路径和漏洞。整体流程可以抽象为三步① 结构学习利用 ByteBERT 自动识别文件 metadata 分布② 精准变异围绕 metadata 执行结构感知变异③ 智能筛选利用 Vision Transformer 判断输入是否合法并筛选高质量样本。图 1. VERTFuzz 概述小结从“盲目变异”转向“结构驱动变异”是性能提升的关键。02—关键机制ByteBERT 结构建模首次利用 BERT 自动标注复杂文件 metadata 分布Metadata-guided Fuzzing将变异限制在高价值区域提升有效性Vision Transformer 筛选机制将 coverage bitmap 转化为图像进行语义判别输入空间压缩显著减少无效样本缓解“稀疏缺陷空间”问题可集成 AFL作为增强模式直接提升现有 fuzzing 框架能力。模块设计思路作用结构识别ByteBERT基于 BERT 自动标注文件中的 metadata 区域获取精确结构语义信息元数据引导变异仅对 metadata 区域进行定向变异提升变异有效性避免无效扰动结构同步更新变异后同步更新结构标注信息保证多轮 fuzzing 的一致性VIT 样本筛选将覆盖 bitmap 转换为图像输入 Vision Transformer过滤非法输入保留高质量样本反馈驱动优化基于路径与结构信息优化种子队列持续提高漏洞触发概率小结VERTFuzz将“结构理解模型筛选”引入fuzzing实现从“随机扰动”到“精准攻击”的跃迁。03—实验结果使用010 Editor的模板文件生成四个训练集PDF、ELF、XML和TIFF文件的格式包括初始种子文件和相应的元数据标签文件。主要实验结果如下。1效率和覆盖范围对比。如表1所示与单独使用相同版本的AFL相比VERTFuzz的覆盖率提高了27.92%在Pdftopng程序中VERTFuzz的覆盖率也比AFL高11.15%。表1. VERTFuz与其他模糊器的效率和覆盖范围的比较。2实验评估了VERTFuzz的真实世界性能。在真实环境中运行了72小时的模糊测试仪共识别出39个错误其中7个也在相同的实验条件下被AFL检测到。此外VERTFuz还发现了32个独特的漏洞Objdump3个漏洞、Readelf1个漏洞Pdfinfo5个漏洞和Pdftotext13个漏洞。其中新发现了13个漏洞并分配了CVE标识符。小结VERTFuzz通过将010 Editor的模板解析能力与基于深度学习的ByteBERT模型相结合实现了PDF等复杂格式文档的自动元数据标记和精确定位。实验结果表明与现有的通用模糊框架相比VERTFuzz显著提高了代码覆盖率和执行效率。在真实环境测试中VERTFuzz成功发现了32个独特的漏洞。 总结VERTFuzz 的核心贡献可以概括为一句话让 Fuzzer 不仅“会变异”还“知道该改哪里、该保留什么”。未来的模糊测试将从“覆盖率驱动”演进为“结构 语义 学习驱动”,特别是在复杂输入场景如文件解析器、协议解析器中。 欢迎留言讨论相比传统 coverage-guided fuzzing引入深度学习模型究竟是“质变”还是“增量优化”在复杂文件解析场景中你更看好“结构建模”还是“生成式方法如 LLM” 点赞 收藏 分享你的支持是我们持续解析高水平软件安全论文的最大动力