没有 真值 的强化学习解决方案可以改进 LLM
Reinforcement Learning without Ground-Truth Solutions can Improve LLMs
摘要
用于训练 LLM 的可验证奖励强化学习 (RLVR) 通常依赖于 真值 答案来分配奖励,这限制了它们对 真值 解决方案未知的任务的适用性。我们引入了一个 \textbf{R}anking-\textbf{i}duced \textbf{VER} 可框架(RiVER),该框架在没有 真值 解决方案的情况下在基于分数的优化任务上训练 LLM,使用确定性执行反馈作为连续值监督。当将群体相关强化学习应用于此类连续奖励时,我们发现了两个关键挑战:\emph{规模优势},即测试实例中未校准的分数大小会扭曲策略更新;以及 \emph{频率优势},即重复采样的次优解决方案可能会超过罕见但更强的候选解决方案。 RiVER 通过校准奖励塑造来解决这些挑战,该奖励塑造使用实例比较并强调顶级求解器,同时保留其他有效解决方案的有限反馈。我们对 12 个 AtCoder Heuristic Contest 任务进行训练,并在算法工程基准 (ALE-Bench)、LiveCodeBench 和 USACO 上进行评估。 RiVER 在 ALE 评级排名中将 Qwen3-8B 和 GLM-Z1-9B-0414 分别提高了 8.9% 和 9.4%。更重要的是,尽管在没有任何 真值 解决方案的情况下专门针对基于分数的任务进行训练,RiVER 还提高了 LiveCodeBench 和 USACO 等精确解决方案基准的骨干网,绝对平均提高了 2.4\% 和 3.5\%。相比之下,使用原始执行分数训练的基线可以提高 ALE 评级,但无法转移到精确解决方案基准。这些结果表明,基于分数的优化任务与适当的奖励校准相结合,可以作为通用编码能力的有效训练环境,而无需 真值 解决方案。