论文
ExecuCritic:用于代码生成的校准批评者塑造,具有可验证的奖励
ExecuCritic: Calibrated Critic Shaping for Code Generation with Verifiable Rewards
摘要
执行反馈对于代码模型来说是一个有用的监督信号,因为单元测试是客观的,可以直接衡量程序的正确性。它的弱点是整个程序通常会减少到一个通过或失败位,让 RLVR 来解决困难的学分分配问题。同时,编码系统通常包括单独的审阅者或测试者角色,但这些批评者通常是被提示的而不是经过训练的,并且没有根据执行进行校准。我们提出了 ExecuCritic,一个联合训练框架,其中编码器和评论家在相同的执行部署上进行更新。批评者预测通过或失败的结果并给出简短的诊断反馈;仅当批评者与当前轨迹组的执行者达成一致时,编码器才使用此信号。在八个代码基准测试和两个最近的开放骨干网中,ExecuCritic 在没有批评者的情况下比 GRPO 进行了改进,提示了审阅者系统和标量奖励模型基线,同时需要更少的策略梯度步骤和沙箱执行。消融和可靠性分析表明,收益来自更好的信贷分配,而不是更大的抽样预算。