论文
SLAT:面向高效CoT推理的段级自适应裁剪
SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning
摘要
大型推理模型(Large Reasoning Models)的最新进展通过强化学习(RL)显著提升了思维链(CoT)能力。然而,生成的推理链经常存在结构冗余(即过度思考,overthinking),在不提升答案正确性的情况下带来高昂的计算开销。现有缓解策略通常依赖逐词均匀的长度惩罚,这类惩罚只提供粗粒度、与段落无关的缩短压力,可能在抑制冗余的同时误伤有用的推理。为此,我们证明低效集中在边际效用较低的高概率段落中。我们在正确性-长度权衡目标下推导出段落次优性的理论刻画,并提出SLAT(Segment-Level Adaptive Trimming,段级自适应裁剪),一个依据该判据选择性抑制冗余段落的强化学习框架。在标准基准上的实证结果表明,SLAT确立了更优的准确率-效率帕累托前沿,在保持有竞争力准确率的同时,相对未压缩基线将推理长度缩短了$50\%$。总体而言,我们的结果表明,有理论依据、段落感知的裁剪是大语言模型高效CoT推理的一个有前景的方向。
