论文
MIST-RL:通过强化学习实现基于变异的增量测试套件生成
MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning
摘要
大语言模型(LLM)常常无法一次生成正确代码,因此需要用生成的单元测试作为验证器来检验解法。尽管近期的验证方法取得了成功,它们仍受“按数量扩展”范式的制约。这种暴力式方法有一个关键局限:故障检测收益递减,同时造成严重的测试冗余。为解决这一问题,我们提出 MIST-RL(Mutation-based Incremental Suite Testing via Reinforcement Learning),把重点转向“按效用扩展”。我们将测试生成表述为一个序列决策过程,并通过组相对策略优化(GRPO)进行优化。具体而言,我们引入新颖的增量变异奖励并辅以动态惩罚,激励模型发现新故障,同时抑制功能等价的断言。在 HumanEval+ 和 MBPP+ 上的实验表明 MIST-RL 优于最先进基线。它取得高出 28.5% 的变异分数,同时把测试用例数量减少 19.3%。此外,我们表明这些紧凑、高效用的测试可作为更优验证器,在 10 个候选样本下将 HumanEval+ 上的下游代码重排序准确率较 SOTA 基线提升 3.05%。源代码和数据在补充材料中提供。