论文

MI-蒸馏:从模型插值指令推理数据谱中选择思想链 蒸馏

MI-Distillation: Selecting from Model-Interpolated Instruct-Reasoning Data Spectrum for Chain-of-Thought Distillation

摘要

大型推理模型 (LRM) 的最新进展通过长思维链 (Long CoT) 推理在复杂问题上表现出了强大的性能。然而,将此类轨迹提炼为较小的学生模型仍然具有挑战性:直接的长 CoT 监督通常提供的收益有限,并且可能不如简洁的短 CoT 原理有效。在这项工作中,我们从以梯度为中心的角度研究了这种现象。我们的分析表明,长 CoT 比短 CoT 产生更大的梯度幅度和更集中的更新方向,随着学生模型容量的增加,这种效应变得更加明显。这些发现表明,有效的 Long CoT 蒸馏 需要平衡推理轨迹的推理信息密度及其与学生模型的分布对齐。受此启发,我们提出了 \textbf{M}odel \textbf{I}nterporlation \textbf{蒸馏} (\textbf{MI-蒸馏}),这是一个通过模型插值构建连续指令推理数据谱的框架。为了从这个频谱中选择合适的轨迹,我们进一步引入 \textbf{Seq}uential \textbf{L}earnable \textbf{S}urprisal \textbf{S}core (\textbf{SeqLSS}),它有利于学生提供信息丰富且可学习的推理路径。推理基准的大量实验表明,与强长 CoT 基线相比,MI-蒸馏 持续改进了小模型 CoT 蒸馏。