论文

Mastermind:仓库级漏洞复现的策略落地学习

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

智能体系统模型训练强化学习Agent 规划RLVRAgentic RL

摘要

仓库级漏洞复现是要求很高的软件工程(SE)任务:智能体必须检查代码库、推断到达漏洞路径的输入文法、构造概念验证(PoC)——并验证崩溃在已修补构建上消失。近期LLM智能体在方法正确时常能执行这些步骤——但仍会因选择错误策略而失败。本文主张:对此类SE智能体——策略而非完整动作轨迹才是正确的学习单元:它足够紧凑可优化——足够具体可指导执行——足够稳定可跨尝试存储复用。我们提出Mastermind——双循环框架——将可迁移的策略学习与任务特定经验分离。可训练规划器经SFT与基于里程碑的GRPO学习可复用的漏洞复现策略——经验循环维护引导后续尝试的任务局部策略记录。规划器独立于执行器训练——使策略学习无需修改动作生成能力即可改进多个冻结执行器。我们在CyberGym上以260个训练任务与200个留出评估任务评估Mastermind。以GPT-5.5为冻结执行器——Mastermind取得84.5%通过率——超越开卷PoC上下文(60.0%)、Best-of-8采样(63.0%)与迭代改进(77.0%)。同一规划器还将GPT-5.4 mini与GLM 5.1从45.0%与58.5%提升至60.0%与71.0%。这些结果表明学习高层策略是改进仓库级SE智能体的有效且可迁移机制。