论文

基于图的思想链剪枝减少推理中的冗余反射 LLM

Graph-Based Chain-of-Thought Pruning for Reducing Redundant Reflections in Reasoning LLMs

模型推理推理策略与问题分解

摘要

通过RL扩展CoT已被广泛用于增强LLM的推理能力。然而,由于奖励信号的稀疏性,它也会引发不良的思维模式,例如过度思考,即产生冗余的中间推理内容。在这项工作中,我们认为这种冗余的一个主要来源是低效的反思,这通常表现为两种有问题的模式:不加区别的反思,模型在整个推理过程中执行广泛的、低影响的检查,以及重复反思,它反复重新验证已经建立的结论。为了解决这个问题,我们引入了基于图的 CoT 优化框架。具体来说,我们将每个线性 CoT 转换为具有显式依赖边的有向无环图(DAG),并设计双重剪枝策略:分支级别剪枝删除贡献较弱的反射分支,而深度级别剪枝消除后期重新验证。我们通过三阶段管道提炼出这种行为:(1) SFT 初始化修剪简洁轨迹的策略,(2) DPO 更喜欢正确但冗余较少的轨迹,(3) 带有长度惩罚的 GRPO 共同优化答案的正确性和效率。实验表明,我们的方法在保持或提高准确性的同时,将平均推理标记减少了 42%。