论文
对LLM的RLVR中样本难度作用的机制性解读
Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs
摘要
可验证奖励强化学习(RLVR)在经验上被证明能显著提升大语言模型(LLM)的推理性能,尤其是在数学与编程方面。然而,样本难度在RLVR中的机制性作用仍知之甚少。本文从难度分档与单样本分析的视角研究RLVR。我们发现样本难度对RLVR具有非单调影响:简单与中等难度问题带来最强、最稳定的推理提升,而过难的问题往往学习信号弱,会诱发答案重复或跳过必要计算等退化行为,并可能最终损害模型既有能力。除响应的表观之外,我们进一步用Temporal Sparse Autoencoder(T-SAE)分析模型内部特征动态。简单问题主要强化直接作答与基础计算特征,同时抑制深思熟虑的推理特征;难题会激活推理相关特征,但只有在采样到成功轨迹时才有用;中等难度问题提供更均衡的信号,同时强化计算与多步推理特征。受这些发现启发,我们提出面向难样本利用的难度自适应策略,利用逆向推理改写与T-SAE引导的训练信号来改善RLVR过程中的奖励密度与贡献归因。总体而言,我们的结果将样本难度确认为支配RLVR优化动态与表征演化的关键因素。
