论文

CRISP:通过内在显着性修剪压缩思想链中的冗余

CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning

模型推理推理加速

摘要

长思维链 (CoT) 推理对于近期推理模型的成功至关重要,但其计算开销和延迟较高。虽然之前的工作尝试通过外部压缩器来压缩 CoT,但它们通常无法与模型的内部推理动态保持一致,从而导致关键逻辑步骤的丢失。本文提出了通过 \textbf{I}ntrinsic \textbf{S}aliency \textbf{P}runing (\textbf{CRISP}) 来压缩思想链中的 \textbf{R}edundancy,这是一个通过利用模型内在显着性来压缩 CoT 的框架。我们的分析揭示了一个明显的现象:推理终止标记 \texttt{[object Object]} 充当信息锚,其注意力模式有效地将基本推理与冗余区分开来。基于这一发现,我们设计了一种策略,利用这些内在的注意力信号来指导原子压缩操作。与粗粒度剪枝策略相比,CRISP 策略性地提炼推理链,以最大化信息密度,同时保持逻辑一致性。各种骨干模型和数学数据集的实证结果表明,CRISP 在不影响准确性的情况下实现了 50-60% 的 token 计数减少,有效缓解了长上下文推理的效率瓶颈。我们开源我们的实现,以促进有效推理的进一步研究。