论文
并非所有token都值得同等信用:面向长CoT推理的反事实敏感度信用重分配
Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning
摘要
可验证奖励强化学习(RLVR)是提升大语言模型长思维链(CoT)推理能力的核心。GRPO等不使用价值评估器的方法将响应级奖励转化为优势并均匀广播到各token,忽视了各token对最终结果贡献的不均等。在线自蒸馏(OPSD)则通过最小化非特权策略与特权自教师之间的前向KL散度提供密集的分布监督,隐含假设由此产生的似然位移编码了可靠的、与答案对齐的信息。我们通过固定每条采样轨迹、在两种相反结果条件(一种断言正确、另一种断言错误)下重新打分来检验这一前提。大多数受影响token在两种条件下朝同一方向移动,符号反转很少,且所诱导的优化信号大量重叠。大幅位移还集中在高度可替换的表层形式token上,而承载问题特定推理内容的token敏感度较低。这些发现表明,特权位移无法提供可靠的答案对齐方向,其幅度主要反映反事实敏感度而非token级学习价值。基于这些观察,我们提出反事实敏感度信用重分配(CSCR),这是GRPO的一个简单扩展:降低高敏感token的信用,并对token级优势重新归一化,以同时保持原有信用预算与验证器确定的方向。在长CoT数学推理基准上,在相同策略更新次数下,CSCR持续优于GRPO基线。针对性消融进一步佐证了我们的诊断:特权诱导的方向不可靠,适度降权最为有效,而过强调制会使优化失稳。
