论文
ThoughtFold:经内省偏好学习折叠推理链
ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning
摘要
得益于思想链(CoT)上可验证奖励的强化学习(RLVR),大型推理模型(LRM)取得了显着的进步。然而,由于长CoT自然包含试错,并且主流RLVR方法选择结果正确的CoT轨迹进行记忆,长CoT中的冗余探索不可避免地被强化,这导致了LRM的过度思考问题。之前解决这个问题的尝试主要是让较短的轨迹更有优势,但它们的学习信号仍然是基于结果的,并且不能减少长 CoT 中冗余探索的记忆。因此,我们提出 ThoughtFold,一个利用细粒度偏好学习来减少冗余探索以实现高效推理的框架。 ThoughtFold 采用内省策略来识别每个正确轨迹中的冗余,从而产生一系列候选子轨迹。利用这个谱,我们引入了一个屏蔽偏好优化目标,该目标明确惩罚冗余探索,并鼓励模型直接桥接基本推理部分,有效地将其推理链折叠成更简洁的路径。大量实验表明,ThoughtFold 显着提高了效率。它将 DeepSeek-R1-Distill-Qwen-7B 的词元使用量减少了约 56%,同时保持了最先进的准确性。
