论文
重新思考 LLM 推理的 RL:它是稀疏策略选择,而不是能力学习
Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning
摘要
强化学习已经成为 大语言模型 中提高推理能力的标准,但越来越多的证据表明强化学习并没有教授新的策略;相反,强化学习并没有教授新的策略。它在基本模型已包含的解决方案上重新分配概率质量。在这项工作中,我们会问:如果强化学习只是将模型引向它已知的路径,那么强化学习优化循环本身是否必要?通过对多个模型系列和 RL 算法的 词元级 分析,我们发现 RL 的有益足迹是稀疏的、可预测的校正,集中在模型不确定要采用哪个分支的高熵决策点。只有 1--3\% 的词元位置受到影响,升级的词元始终位于基本模型的前 5 个替代方案中,并且对这几个位置的针对性修正会因果性地恢复 RL 准确性增益的很大一部分,而随机修正则失败。基础模型自身的熵无需任何强化学习训练模型即可识别这些位置,并且整个校正是低维的,可以用一小部分模型参数来表示。这些发现将推理改进重新定义为稀疏的策略选择,而不是能力获取。我们将这一见解转化为 ReasonMaxxer,这是一种最小的无 RL 方法,仅在熵门控决策点应用对比损失,使用数百个基本模型采样轨迹,并且没有在线生成。在三个模型系列、六个尺度和六个数学推理基准中,ReasonMaxxer 匹配或超过了完整的 RL 性能,同时只需要数十个问题和几分钟的单 GPU 训练,将训练成本降低了大约三个数量级。