论文

带有参与奖杯的探索:随机奖励强化学习作为大语言模型能力的探索

Probe with Participation Trophies: Random-Reward RL as a Probe of LLM Capability

模型评测模型行为与机制分析

摘要

我们将虚假奖励悖论与模型的可达性联系起来,并提出随机奖励强化学习(RL)作为探索企业的有用工具,解决了长达十年的关于探索性能实际上揭示了模型什么的争论。对于这一令人惊讶的发现,即随机奖励也能提高大语言模型 (LLM) 的性能,有两种流行的解释:一种将收益归因于 RL 训练中的特定机制;另一种将收益归因于 RL 训练中的特定机制。另一个是数据污染。我们的结果激发了不同的观点:虚假奖励强化学习可以探测模型的可达性,或者在指定的约束下从当前状态进一步训练可以获得什么,超出其当前性能所反映的范围。例如,在合成算术上具有相同准确度 (3.5%) 的两个 OLMo 检查点在相同正确性奖励 RL 下的最佳运行中分别达到 8.5% 和 55%。检查训练前和训练中期的 OLMo 检查点揭示了三种不同的训练响应机制:早期,即使正确答案得到奖励,强化学习也几乎没有什么改进;在预训练后期,奖励正确答案变得有效,而随机奖励仍然较弱;而且,进入训练中期后,即使是随机奖励也能产生巨大的收益。这些检查点的数字屏蔽监督微调 (SFT) 分析中出现了类似的顺序,表明该模式并非特定于特定的 RL 机制。此外,带有随机奖励的强化学习为大语言模型的训练提供了独特的视角,因为它的奖励信号不提供有关哪些答案是正确的信息。通过询问在没有正确性反馈的情况下训练可以实现什么,它解决了基于可解码性的探测中的核心问题的标签泄漏方面:成功的探测是否揭示了模型的功能或学习任务本身。