论文
CVeDRL:经难度感知强化学习的高效代码验证器
CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning
摘要
代码验证器在基于LLM的代码生成后验证中扮演关键角色,然而现有监督微调方法受困于数据稀缺、高失败率与推理效率低。虽然强化学习(RL)通过执行驱动的奖励在无标注监督下优化模型提供了有前景的替代,我们的初步结果显示,仅有功能性奖励的朴素RL无法为困难分支与样本生成有效单元测试。我们首先进行理论分析,表明分支覆盖、样本难度、语法与功能正确性可被联合建模为RL奖励,优化这些信号能够提升基于单元测试验证的可靠性。在此分析指导下,我们设计语法与功能感知奖励,并进一步提出利用指数奖励塑形与静态分析指标的分支及样本难度感知RL。借助该构造,CVeDRL仅以0.6B参数即达最先进性能,pass率比GPT-3.5最高提升28.97%、分支覆盖最高提升15.08%,同时推理速度比有竞争力的基线快20倍以上。代码见 https://github.com/LIGHTCHASER1/CVeDRL.git。
