论文
TestDecision:通过贪婪优化和强化学习生成顺序测试套件
TestDecision: Sequential Test Suite Generation via Greedy Optimization and Reinforcement Learning
摘要
随着 LLM 的快速发展,自动化软件测试正在见证范式转变。虽然 GPT-4o 等专有模型展示了令人印象深刻的功能,但其高昂的部署成本和数据隐私问题使得开源 LLM 成为许多学术和工业场景的实际需要。在自动化测试生成领域,已经发展到基于LLM构建测试套件的迭代工作流程。当使用开源LLM时,我们凭经验观察到它们缺乏套件级别的视角,患有结构性短视——无法根据当前覆盖的状态生成具有较大边际收益的新测试。在本文中,从序列的角度来看,我们将测试套件生成形式化为 MDP,并证明其目标表现出单调子模性,这使得能够将这种 NP 难全局优化有效地放松为易于处理的逐步贪婪过程。在这一见解的指导下,我们提出了 TestDecision,它将 LLM 转变为神经贪婪专家。 TestDecision 由两个协同组件组成:(1)推理框架,按照逐步贪婪策略实现测试套件构建; (2)强化学习的训练管道,为基础LLM配备顺序测试生成能力,以最大化边际增益。对 ULT 基准的综合评估表明,TestDecision 显着优于现有的先进方法。与所有基础模型相比,它的分支覆盖率提高了 38.15-52.37%,执行通过率提高了 298.22-558.88%,在 7B 主干上实现了与更大的专有 LLM GPT-5.2 相当的性能。此外,TestDecision 比普通基础 LLM 发现的错误多了 58.43-95.45%,并在 LiveCodeBench 上表现出卓越的泛化能力,证明了其构建高质量测试套件的能力。