论文

每个词元都会在思想流中留下涟漪:引出模型内部词元显着性以进行思想链压缩

Every Token Leaves a Ripple in the Stream of Thought: Eliciting Model-Internal Token Saliency for Chain-of-Thought Compression

模型训练合成数据

摘要

思想链 (CoT) 推理改进了多步骤问题解决,但长推理轨迹会增加推理成本。 词元级 CoT 压缩通过将完整的推理链修剪成更短的轨迹以进行模型适应来降低这种成本,从而使词元选择成为核心挑战。现有方法通常依赖于外部评分器或启发式信号,仅间接与模型的内部答案计算相关。相反,我们采用模型内部的视角:当模型形成答案时,每个推理标记都会在残差流(模型的 \emph{思想流})中留下涟漪,而该涟漪的大小反映了标记对答案计算的贡献。基于这个观点,我们提出 \textsc{MIST} (词元级 CoT 压缩的模型内部显着性),它沿两个互补轴定义词元重要性:\emph{necessity},当词元的内部贡献被删除时答案可能性的下降,和 \emph{sufficiency},当单独提供该贡献时答案可能性的增益。将两者结合起来可以得出修剪的统一重要性得分。在四个推理基准和四个模型中, \textsc{MIST} 始终优于基线方法,这表明模型内部显着性为推理标记重要性提供了有效的代理。