论文

超越推理:强化学习解锁 LLM 中的参数化知识

Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs

模型训练强化学习

摘要

强化学习(RL)在 LLM 推理方面取得了显着的成功,但它是否也能提高参数化知识的直接回忆仍然是一个悬而未决的问题。我们在受控的零样本、一跳、闭卷 QA 设置中研究这个问题,没有思想链,仅对二元正确性奖励进行训练,并应用事实级训练测试重复数据删除,以确保收益反映改进的回忆而不是推理或记忆。在三个模型系列和多个事实 QA 基准中,强化学习产生约 27% 的平均相对增益,超过了训练和推理时间基线。从机制上讲,强化学习主要是在现有知识上重新分配概率质量,而不是获取新事实,将正确答案从低概率尾部转移到可靠的贪婪生成中。我们的数据归因研究表明,最难的例子信息量最大:那些答案从未出现在 128 个 RL 前样本(仅约 18% 的训练数据)中的样本驱动了约 83% 的增益,因为在训练过程中仍然会出现罕见的正确采样轨迹并得到强化。总之,这些发现拓宽了强化学习的作用,超越了推理,将其重新定位为解锁而不是获取潜在参数知识的工具。