
模糊测试Fuzzing是目前最有效的漏洞挖掘技术之一而 AFLAmerican Fuzzy Lop是最具代表性的覆盖率引导 fuzzing 工具。然而AFL 的变异过程存在两大痛点确定性变异阶段穷举式遍历变异策略和位置计算开销大Havoc 随机变异阶段随机拼接变异策略链产生大量无效样本。北航团队提出 DPRFuzz首次将强化学习RL引入 AFL 两大变异阶段实现「精准引导 高效探索」。论文标题DPRFuzz: Enhancing Vulnerability Mining With Two-Stage Reinforcement Learning发表期刊IEEE Transactions on Industrial Informatics, Vol.21, No.11, November 2025作者单位北京航空航天大学、北京邮电大学开源代码http://github.com/Lastfarewell2/RLFuzz01 方法介绍DPRFuzz 采用两阶段 RL 优化策略①确定性变异策略优化DQN TRPO——将变异过程建模为马尔可夫决策过程通过 Q 值函数预测最有效的变异算子变异策略 × 变异位置利用经验回放机制加速训练通过 KL 散度约束新旧策略的相似性保证策略更新的稳定性同时提升经验利用率。两者结合既能高效探索又能稳定收敛。②Havoc 随机变异优化改进的 TS 算法——将 Havoc 阶段的选择建模为多臂老虎机问题利用 Beta 分布建模各策略的有效概率引入多智能体投票机制多个代理从不同角度学习变异奖励输出全局最优的变异策略链。小结DQN/TRPO 负责「精准预测有效变异算子」改进 TS 负责「高效生成变异策略链」两阶段协同互补增强。02 关键机制价值-策略双导向模型——DQN 负责 Q 值预测TRPO 约束策略更新两者结合解决确定性变异阶段的盲目性问题。改进的 Thompson Sampling——用 Beta 分布建模变异策略有效概率轻量级平衡探索与利用。多智能体投票机制——多个代理从不同角度学习变异奖励协同输出全局最优策略链。轻量化设计——单轮变异额外时间小于 1.5 秒性价比极高。小结四个机制形成「精准预测 → 高效生成 → 协同优化 → 轻量落地」的完整闭环。03 实验结果在 8 个真实程序readelf、nm、objdump、tcpdump、jpegtran、tiffsplit、minigzip、xmllint上运行 24 小时对比 AFL、AFL、AFLSmart1变异算子预测准确率AFL-TTTRPOTS在 nm 上对 11 种变异操作实现最高 EPParith 8/8 操作 EPP 达 8.35较原版 AFL 提升 8.16。2边缘路径发现tiffsplit 路径数提升 87.2%tcpdump 24 小时 EPN 达 332624.2%。3有效输入生成tcpdump IG 值达 8537较原版 AFL 提升 76.7%。4Crash 发现总计 312 个 crashvs AFL 原版 73 个tcpdump 提升 239 个。5性能排序AFL-TT AFL-DT AFL-TRPO AFL-DQN证明联合优化优于单一模型。小结两阶段 RL 协同优化覆盖率提升 10%crash 数量显著增加。04 零日漏洞发现DPRFuzz 在真实软件中发现了 5 个零日漏洞•apng2gif内存泄漏可导致系统崩溃•jpegtran×2、tiffsplit内存损坏•qpdf×2内存分配器漏洞处理加密/多页/旋转 PDF 时崩溃 总结DPRFuzz 首个将 RL 引入 AFL 两大变异阶段提出价值-策略双导向模型DQN/TRPO解决确定性变异盲目性设计轻量级探索-利用平衡机制改进 TS优化 Havoc 策略链24 小时实验证明覆盖率提升 10%发现 5 个零日漏洞。将漏洞发现从「穷举 随机」升级为「智能引导 高效探索」标志着 RL 与 Fuzzing 的深度融合成为漏洞挖掘新方向。 欢迎留言讨论• 你认为 RL Fuzzing 的结合会催生下一代金手指纹工具吗• 强化学习在二进制安全领域还有哪些潜力场景 点赞 收藏 分享你的支持是我们持续解析高水平软件安全论文的最大动力