论文

ChainPrune:评估和减少长链思维推理中的冗余

ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning

模型训练合成数据

摘要

思想链(CoT)推理通过引入显式中间推理,显着增强了 大语言模型(LLM)的多步问题解决能力。然而,先进的大型推理模型(LRM)经常表现出过度思考的行为,包括推理步骤过长、步骤冗余和计算开销过高。现有的词元长度奖励策略旨在促进简洁的输出,但通常会导致伪简洁,其中词元数量减少,但冗余推理仍然存在,导致链更长且结构效率较低。为了解决这些限制,我们提出了 ChainPrune,一种新颖的推理路径语义结构优化方法,可以高效、可控地合成自生成的高质量训练数据。我们首先将自生成的推理路径整合到基于树的结构中,然后是用于偏好数据构建的多标准主导路径选择过程,该过程制定浅层推理轨迹,同时保留基本推理步骤。为了进一步提高推理质量,我们将基于 DPO 的偏好学习方法与监督损失相结合,有效地减轻了错误奖励抑制。这种创新的集成显着提高了我们推理框架的效率和有效性。综合实验结果表明,在保持甚至提高准确性的同时,步长和计算开销显着减少。