论文

压缩思维链:压缩推理数据在LLM后训练中何时及如何起作用

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

模型评测模型训练强化学习模型行为与机制分析RLVR

摘要

大语言模型(LLM)如今能够通过长思维链(CoT)推理解决复杂问题,但性能与token成本之间的权衡仍是核心挑战。为应对这一问题,监督微调(SFT)常使用压缩推理数据,将CoT轨迹缩短为紧凑形式。然而,这类压缩推理数据对后训练的影响仍缺乏充分理解。本文提出一个CoT分类体系:显式CoT(输出所有操作而不做聚合)、组合CoT(将多个操作合并为单步)与隐式CoT(省略中间操作)。作为一项受控的机理研究,我们构建了一个可对难度、压缩粒度与数据规模进行受控变化的合成组合推理任务,并在不同模型家族与规模上开展了全面的实验。值得注意的是,我们发现:(i) 更粗粒度的CoT需要更多SFT数据;(ii) 与显式CoT相比,组合CoT与隐式CoT从数据扩展中获益更多,其中组合CoT受益于数据重复,而隐式CoT容易导致记忆化;(iii) 与SFT不同,后续基于可验证奖励的强化学习(RLVR)会分解SFT阶段学到的压缩步骤;(iv) 单向CoT排序在更长的序列任务上表现出更强的泛化能力。我们的发现为数据资源受限下的CoT设计提供了启示,并为理解LLM后训练中SFT与RL的机制提供了重要洞见。

压缩思维链:压缩推理数据在LLM后训练中何时及如何起作用
图 1:(a) CoT 分类。 op = 4 \texttt{op}=4 任务的示例。 f i {\color[rgb]{0.7227,0.2891,0.2891}f_{i}} 表示操作,s i {\color[rgb]{0.2305,0.4297,0.6602}s_{i}} 表示值。有关任务说明,请参见图 2。 (b) SFT 和训练步骤中的 CoT 粒度。粗粒度的 CoT SFT 需要更多的训练步骤。 (c) 数据缩放与数据重复。压缩的 CoT 从数据扩展中受益匪浅。组合 CoT 受益于数据重复,而隐式 CoT 则受到数据重复的不利影响。 (d) RLVR 的步骤分解。 RLVR 中的在策略探索可以分解压缩的推理步骤。 (b)、(c)和(d)中的结果来自Qwen2.5-3B。