论文
两个比一个好:无崩溃的多奖励 RLIF 训练框架
Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework
摘要
具有可验证奖励的强化学习(RLVR)极大地提高了 LLM 的推理能力,但通常依赖于来自人类注释或黄金标准解决方案的外部监督。最近,基于内部反馈的强化学习 (RLIF) 已成为一种可扩展的无监督替代方案,使用从模型本身提取的信号。然而,现有的 RLIF 方法通常依赖于单一的内部奖励,这可能导致 奖励作弊、熵崩溃和推理结构退化。我们提出了一个多奖励 RLIF 框架,它将训练信号分解为两个互补的组成部分:基于集群投票的答案级别奖励和基于 token-wise 自我确定性的完成级别奖励。为了稳健地结合这些信号,我们应用基于 GDPO 的标准化来减少奖励规模不平衡。我们进一步引入 KL-Cov 正则化,其目标是低熵词元分布,负责不成比例的熵减少,保留探索并防止后期崩溃。在数学推理和代码生成基准测试中,我们的方法比之前的无监督 RL 方法提高了稳定性和鲁棒性,同时实现了接近有监督 RLVR 方法的性能。这些结果表明,互补的内部奖励与有针对性的正则化相结合,可以支持稳定的长期推理,而无需依赖外部 真值 监督。代码即将发布。