论文

超越 pass@k:用于多样本代码生成的冗余感知 RLVR

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

模型训练强化学习

摘要

用于代码生成的 LLM 通常使用 Pass@k 在重复采样设置中进行评估,其中在有限采样预算下针对单元测试执行多个候选程序。虽然最近基于验证者的强化学习(RLVR)方法提高了可执行的正确性,但这些目标如何影响采样程序之间的冗余仍然知之甚少。在这项工作中,我们使用 JPlag(一种代码抄袭检测系统)研究代码生成中的实现级冗余。在模型和基准测试中,我们表明,仅注重正确性的 RLVR 通常将几代人集中在重复实现上,而 Pass@k-aware 目标则保持较低的冗余并提高较大预算的性能。受这些观察的启发,我们通过基于 JPlag 相似性的直接反冗余奖励来增强 RLVR。在 3 个模型和 3 个基准测试中,阻止近乎重复的生成可以可靠地提高有限预算的可执行性能,通常匹配或优于专门的 Pass@k-aware 目标。