论文

SLAT:面向高效CoT推理的段级自适应裁剪

SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning

模型训练强化学习

摘要

大型推理模型(Large Reasoning Models)的最新进展通过强化学习(RL)显著提升了思维链(CoT)能力。然而,生成的推理链经常存在结构冗余(即过度思考,overthinking),在不提升答案正确性的情况下带来高昂的计算开销。现有缓解策略通常依赖逐词均匀的长度惩罚,这类惩罚只提供粗粒度、与段落无关的缩短压力,可能在抑制冗余的同时误伤有用的推理。为此,我们证明低效集中在边际效用较低的高概率段落中。我们在正确性-长度权衡目标下推导出段落次优性的理论刻画,并提出SLAT(Segment-Level Adaptive Trimming,段级自适应裁剪),一个依据该判据选择性抑制冗余段落的强化学习框架。在标准基准上的实证结果表明,SLAT确立了更优的准确率-效率帕累托前沿,在保持有竞争力准确率的同时,相对未压缩基线将推理长度缩短了$50\%$。总体而言,我们的结果表明,有理论依据、段落感知的裁剪是大语言模型高效CoT推理的一个有前景的方向。

SLAT:面向高效CoT推理的段级自适应裁剪:论文配图
图 1:推理轨迹中冗余的案例研究。尽管模型输出了正确的答案,但它生成了一个很长的 CoT,其中包含重复的重述(问题条件和琐碎的推论);这些标记形成高概率片段(较暗的阴影),指示近确定性、低信息内容。附录 D.1 中提供了其他情况。