论文
压缩思维链:压缩推理数据在LLM后训练中何时及如何起作用
Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training
摘要
大语言模型(LLM)如今能够通过长思维链(CoT)推理解决复杂问题,但性能与token成本之间的权衡仍是核心挑战。为应对这一问题,监督微调(SFT)常使用压缩推理数据,将CoT轨迹缩短为紧凑形式。然而,这类压缩推理数据对后训练的影响仍缺乏充分理解。本文提出一个CoT分类体系:显式CoT(输出所有操作而不做聚合)、组合CoT(将多个操作合并为单步)与隐式CoT(省略中间操作)。作为一项受控的机理研究,我们构建了一个可对难度、压缩粒度与数据规模进行受控变化的合成组合推理任务,并在不同模型家族与规模上开展了全面的实验。值得注意的是,我们发现:(i) 更粗粒度的CoT需要更多SFT数据;(ii) 与显式CoT相比,组合CoT与隐式CoT从数据扩展中获益更多,其中组合CoT受益于数据重复,而隐式CoT容易导致记忆化;(iii) 与SFT不同,后续基于可验证奖励的强化学习(RLVR)会分解SFT阶段学到的压缩步骤;(iv) 单向CoT排序在更长的序列任务上表现出更强的泛化能力。我们的发现为数据资源受限下的CoT设计提供了启示,并为理解LLM后训练中SFT与RL的机制提供了重要洞见。
