论文

基于多样性筛选测试的信息增益奖励:以真值锚定的验证器协同训练实现可靠代码生成

Information-Gain Rewards over Diversity-Pruned Tests: GT-Anchored Verifier Co-Training for Reliable Code Generation

模型训练强化学习RLVR

摘要

将单个语言模型同时作为编码器与测试作者进行协同训练的自博弈方法,有望使代码生成RL超越固定测试套件,但存在两种相互纠缠的病态:宽松性坍缩——通过率奖励被琐碎、无鉴别力的测试最大化;集中偏置——独立同分布采样的测试聚集在模态输入上,推高估计器方差。我们提出CoVer(协同训练的编码器与验证器),一个同时应对这两种失效模式的单策略GRPO框架。首先,信息增益(IG)奖励依据每个自生成测试的通过/失败向量与分级、真值锚定的正确性信号y∈[0,1]^m之间的互信息为其打分,并以二者协方差的符号作门控,使只有正向具有鉴别力的测试获得奖励。其次,三阶段多样性感知选择步骤将候选池精简为行为上非冗余的测试套件(无效性、输入字符串、执行画像过滤),在固定执行预算下提高IG估计器的有效样本量。在五个基准(LiveBench、MBPP、LiveCodeBench、CodeContests、Codeforces)上,CoVer在Qwen2.5-Instruct骨干之上,7B规模一次性pass@1提升5.8个百分点、14B提升7.1个百分点,并在两个规模上取得所有比较方法中最高的宏平均。作为CodeT排序流水线中的即插即用骨干,CoVer-7B额外带来3.5个百分点,展示了协同训练对生成与选择的双重收益。

基于多样性筛选测试的信息增益奖励:以真值锚定的验证器协同训练实现可靠代码生成:论文配图
图 2:CoVer 流程概览。给定程序规约,单一共享策略 πθ 扮演编码者与验证者两种角色,采样候选解池 {c_i} 与候选测试池 {t_j}。在轨迹执行期间,每个解都在每个测试上运行以填充执行表 E;同时,每个解在真值测试上运行以计算分级正确性信号 y。CoVer 验证者信号随后 (1) 应用三阶段多样性感知选择,将候选池剪枝为行为上非冗余的套件,(2) 保留由不同测试组成的验证者组 S_T,(3) 为每个保留的测试分配经协方差门控的信息增益奖励,使得只有具有正向判别力的测试获得奖励。最后,在 GRPO 更新中,编码者奖励和基于 S_T 的验证者信息增益奖励共同更新共享策略,并反馈到下一轮。