论文
影响力导向的 蒸馏:解决采样词元中的多样性瓶颈 同策略 蒸馏
Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation
摘要
采样词元 同策略 蒸馏 (OPD) 使用学生生成的词元有效地将能力从教师转移到学生,仅需要教师采样词元的概率。然而,它经常遭受多样性 蒸馏 失败的困扰:学生的 pass@1 有所提高,而其 pass@$k$ 却停滞不前,未能继承教师的多样性。为了解释这一点,我们引入一阶局部熵影响,这是一个带符号的一阶代理,它将每次更新的熵效应解耦为教师-学生对数概率差距和学生的局部概率结构,并凭经验将熵收缩与负影响位置联系起来。受此启发,我们提出了 Influence-Directed Adaptive 同策略 蒸馏 (IDA-OPD):它不依赖于昂贵的全词汇量 Forward-KL 目标,而是保留熵扩展更新,同时用散度自适应优势收缩替换熵收缩更新,仅使用教师的采样词元对数概率。面向推理的 蒸馏 实验表明,IDA-OPD 持续改进 pass@$k$,通过 蒸馏 继承教师的多样性,以严格较低的成本匹配最强的教师知情方法,并广泛维持普通 OPD 的 pass@1,所有这些都没有完整词汇的教师信息。