论文

在策略自蒸馏中尊重自不确定性以实现高效LLM推理

Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning

摘要

在策略(on-policy)自蒸馏在推理模型自身的rollout上对其进行训练,同时由一个教师——通常是同一模型在特权上下文条件下——提供稠密的词元级监督。现有目标函数通常在整条思维链(chain-of-thought)序列上对教师的词元级信号均匀加权,尽管教师预测分布的熵存在很大差异。我们提出EGRSD(Entropy-Guided Reinforced Self-Distillation,熵引导强化自蒸馏),它通过三个信号统一词元级更新:以奖励为根据的方向、师生似然比幅度,以及所提出的教师熵置信门——该门降低高熵词元位置的权重,同时为每个词元权重保持非零下界。我们进一步引入CL-EGRSD,一个因果前瞻变体,能够区分持续的高熵区段与瞬态高熵位置——后者的后继上下文迅速变为低熵。在思考模式下对Qwen3-4B和Qwen3-8B的实验表明,在所比较的可训练方法中,EGRSD和CL-EGRSD推进了准确率-长度前沿。

在策略自蒸馏中尊重自不确定性以实现高效LLM推理:论文配图
图 3:代表性推理轨迹上的每个token的预测熵 (Qwen3-4B)。标记根据教师的熵进行颜色编码,并在顶部 ∼35%{\sim}35\% 的位置处以粗体显示。高熵token集中于话语转换和策略转变。低熵标志着常规计算。附录 H 给出了带有 H^i,t\widehat{H}_{i,t} 和 H^i,tCL\widehat{H}_{i,t}^{\mathrm{CL}} 的注释版本。