论文
给予应有的信任:冗余意识学习以实现高效推理
Giving Credit Where It's Due: Redundancy-Aware Learning for Efficient Reasoning
摘要
大型推理模型可以产生正确但不必要的长推理轨迹。现有方法通过轨迹级目标或本地标记和步骤级信号提高推理效率,但很少对步骤间语义依赖关系进行建模。这限制了他们区分冗余步骤和支持后续推论的能力,使得在不牺牲准确性的情况下缩短推理变得更加困难。我们引入了 RECAP(通过传播进行冗余感知信用分配),它根据步骤在推理结构中的下游角色及其对正确解决问题的贡献来分配应得的信用,从而解决了这一限制。我们定义结构责任来捕获步骤的下游角色,方法是测量后续推理对其的依赖程度,使用从最终答案节点通过结果无关的、LLM 注释的语义依赖图向后传播的信用。然而,某个步骤可能具有较高的结构责任,但却使推理偏离了正确的解决方案。因此,RECAP 引入了步骤功效,通过添加每个步骤时黄金答案对数似然的变化来衡量答案导向的进展。这些信号共同将轨迹级 GRPO 优势重塑为特定步骤的更新。 RECAP 既不需要单独训练的过程奖励模型,也不需要预先构建的简洁轨迹。在两个 7B 模型和四个数学推理基准中,RECAP 改善了准确性与效率的权衡。在 Qwen2.5-Math-7B 上,它在所有四个基准测试中将 pass@1 提高了 2.0-3.7 个百分点,同时相对于 GRPO 减少了 8%-31% 的推理标记。分析表明,这些节省反映了更少的推理操作和更少的死胡同推理,而不是更紧凑的表达。