论文
内在奖励何时对代码推理有效?一项综合研究
When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study
摘要
可验证奖励强化学习(RLVR)推动了大语言模型推理的实质性进展——但依赖昂贵或不可行的真值监督——尤其在编码任务中。近期工作经从模型自身信号(如多数投票或置信度分数)导出奖励解决此问题——在数学推理基准上取得显著成功。但代码生成带来独特挑战:程序结构复杂、语义等价的解法可能句法不同——且验证通常需要执行。这些内在奖励方法是否有效迁移到代码仍未被探索。本工作中——我们对代码生成的内在奖励方法做系统实证研究。我们在LiveCodeBench上开展大量实验——系统评估代表性基于确定性的内部反馈强化学习(RLIF)方法在不同训练场景与超参设置下。实验揭示:基于确定性的方法产生早期增益——但不可避免坍缩:模型渐进缩短输出、丧失推理能力——坍缩速度对样本量与温度敏感。当用于初始化RLVR训练时——RLIF预训练较从零训练无显著改进。我们还为把内在奖励用于训练代码推理模型提供可行建议。我们的研究展示内在奖励方法在代码上的前景与局限——为未来代码模型与智能体工作提供参考。
