论文
每个硬币都有两面:论同策略 蒸馏 和大语言模型 中泛化的双重性
Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models
摘要
同策略 蒸馏 (OPD) 通过监督从学生自己的策略中采样的轨迹来转移教师的能力,但其泛化行为仍然知之甚少,因为大多数研究在单个领域和接近训练数据的基准上评估 OPD。我们提出了一项对照研究,每次改变一个泛化因素,从域内分布转移到跨域转移和多教师设置。我们发现 OPD 转移了教师的推理行为,而不是其对特定问题的答案:训练难度几乎不重要,甚至教师从未解决过的问题也是有用的。迁移在很大程度上取决于教师和学生之间的起源关系:同源对使学生在语言、推理视野甚至其他领域与教师更加接近,而跨源对大多符合训练后的分布。这种广泛的影响力是一把双刃剑:由于向领域专家发送提示无法限制每个教师的影响力,因此将他们结合起来会在他们的能力之间产生依赖于混合的跷跷板。这些结果阐明了 OPD 何时普遍化,并为诊断多教师 OPD 提供了有用的视角。