论文

通过动态词元选择进行稳健推理以实现分布对齐的自 蒸馏

Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation

摘要

Self-蒸馏通过将参考答案重写为更符合模型自身分布的训练数据来提高学习效率。然而,参考答案也会引入强烈的文体偏差,导致生成模型模仿表面形式而不是学习有用的推理模式。我们观察到重写数据包含大量高困惑度(PPL)标记,它们来自两个不同的来源:有益的知识增强逻辑更正,以及由参考模仿引起的有害的文体漂移。平等对待所有此类标记可能会破坏基本模型的原始分布并降低性能,尤其是在困难的推理任务上。为了解决这个问题,我们提出了 Distribution-Aligned Self-蒸馏 (DASD),它使用答案感知​​参考模型来生成候选标记,并根据基本模型的置信度动态过滤它们。 DASD 保留了对有用的逻辑知识进行编码的标记,同时抑制了分布不对齐的风格噪声。对数学、代码和常识推理基准的实验表明,DASD 始终优于竞争基准,减少了高 PPL 标记,并提高了不同难度任务的鲁棒性。