论文

内在奖励何时对代码推理有效?一项综合研究

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study

模型评测模型训练强化学习模型行为与机制分析RLVR

摘要

可验证奖励强化学习(RLVR)推动了大语言模型推理的实质性进展——但依赖昂贵或不可行的真值监督——尤其在编码任务中。近期工作经从模型自身信号(如多数投票或置信度分数)导出奖励解决此问题——在数学推理基准上取得显著成功。但代码生成带来独特挑战:程序结构复杂、语义等价的解法可能句法不同——且验证通常需要执行。这些内在奖励方法是否有效迁移到代码仍未被探索。本工作中——我们对代码生成的内在奖励方法做系统实证研究。我们在LiveCodeBench上开展大量实验——系统评估代表性基于确定性的内部反馈强化学习(RLIF)方法在不同训练场景与超参设置下。实验揭示:基于确定性的方法产生早期增益——但不可避免坍缩:模型渐进缩短输出、丧失推理能力——坍缩速度对样本量与温度敏感。当用于初始化RLVR训练时——RLIF预训练较从零训练无显著改进。我们还为把内在奖励用于训练代码推理模型提供可行建议。我们的研究展示内在奖励方法在代码上的前景与局限——为未来代码模型与智能体工作提供参考。

内在奖励何时对代码推理有效?一项综合研究:论文配图
图 6:LiveCodeBench v5 上正确(绿色)和错误(红色)解决方案的四个确定性度量的分布,使用步骤 105 中的概率差异方法。虚线表示类别平均值; rr 表示秩双列相关。