论文

SMOPD:按词元熵筛选监督,稳定含错误历史的多轮自蒸馏

SMOPD: Selective Token-Entropy Masking for Dirty-History Multi-Turn On-Policy Self-Distillation

摘要

多轮同策略自蒸馏易受错误历史影响:学生一旦输出错误中间回答,后续轮次都以其为条件,均匀蒸馏又可能把损失分配到缺乏纠正信号的词元。SMOPD仅修改损失以稳定训练:对每条中间回答按学生词元熵排序,从截断的广义Jensen–Shannon蒸馏损失中移除最低熵20%,保持最终答案及FULL保留损失不变。不增加参数,推理开销为零。研究与用最终答案正确性乘以共同停止梯度可靠性代理的方案比较。在LiC及Qwen3上,1.7B、4B、8B单随机种子比较的SHARDED准确率提高1.0–2.5个百分点;4B小规模多种子检查平均提高1.7个百分点,双侧p=0.022。不掩蔽时增加结果标量使1.7B下降4.0个百分点;与掩蔽结合的影响依规模而变,4B提高1.3个百分点、1.7B中性、8B下降0.5个百分点。该设置的归档结果支持词元级不确定性比最终正确性标量更能稳定训练,机制与更广基准仍待验证。