论文

ThoughtFold:经内省偏好学习折叠推理链

ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning

模型训练偏好优化

摘要

得益于思想链(CoT)上可验证奖励的强化学习(RLVR),大型推理模型(LRM)取得了显着的进步。然而,由于长CoT自然包含试错,并且主流RLVR方法选择结果正确的CoT轨迹进行记忆,长CoT中的冗余探索不可避免地被强化,这导致了LRM的过度思考问题。之前解决这个问题的尝试主要是让较短的轨迹更有优势,但它们的学习信号仍然是基于结果的,并且不能减少长 CoT 中冗余探索的记忆。因此,我们提出 ThoughtFold,一个利用细粒度偏好学习来减少冗余探索以实现高效推理的框架。 ThoughtFold 采用内省策略来识别每个正确轨迹中的冗余,从而产生一系列候选子轨迹。利用这个谱,我们引入了一个屏蔽偏好优化目标,该目标明确惩罚冗余探索,并鼓励模型直接桥接基本推理部分,有效地将其推理链折叠成更简洁的路径。大量实验表明,ThoughtFold 显着提高了效率。它将 DeepSeek-R1-Distill-Qwen-7B 的词元使用量减少了约 56%,同时保持了最先进的准确性。

ThoughtFold:经内省偏好学习折叠推理链:论文配图
图 1:RLVR 和 ThoughtFold 之间的比较。结果正确的 CoT(中)自然包含冗余探索。 RLVR(左)通过统一强化整个 CoT 来记住这些步骤。相比之下,ThoughtFold(右)识别并惩罚冗余步骤,通过鼓励基本推理片段之间的直接桥接来折叠推理链。