论文
DF-OPD:无需外部数据的同策略蒸馏
Data-free On-policy Distillation
摘要
同策略蒸馏(OPD)已成为前沿训练后管道的标准组成部分,但其训练数据的实际贡献在很大程度上尚未得到检验。在实践中最常见的两个师生配对中,我们发现 OPD 对其数据几乎不感兴趣:八个提示已经匹配了 17k 问题的数据集,而三个独立构建的数据集(其难度和师生 KL 相差数倍)产生了几乎无法区分的训练曲线。造成这种情况的原因有两个。首先,OPD 中的数据单位是提示导致的状态,而不是提示本身:随着采样的继续,单个提示不断暴露新的教师修正,而附加提示的边际值在八次之后崩溃。其次,用竞争性编程代替数学仍然可以恢复超过 90% 的领域内增益,这表明 OPD 转移的是教师的推理模式,而不是与数据相关的知识。我们通过\textbf{无数据的策略蒸馏}(DF-OPD)将其发挥到极致,其中教师在简单的提示下编写自己的训练问题——没有外部数据,没有质量过滤——留下一个只有两个策略的系统。 DF-OPD 匹配甚至超越了真实数据,它产生的问题跟踪了教师自己的关于训练动态的三个关键诊断的训练后数据,这是其他真实数据集所没有的。应用于多教师蒸馏时,(提示、域)对通常必须从通常无法达到的训练后数据中导出,1k 个自行生成的问题接近 98.5% 的可用空间,甚至超过了 7k 个真实示例达到的 96.6%。这些结果共同引发了对数据在 OPD 中所扮演的角色的重新评估。