论文
重新审视大模型同策略蒸馏:仅用一个训练查询
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
摘要
同策略蒸馏(OPD)将学生生成的采样轨迹与教师的密集token级监督结合起来。现有的工作主要研究其算法行为,而训练数据的作用尚不清楚。我们通过对单个查询进行训练来在数据最小限制下检查此角色。一次性 OPD 持续改进数百步,并恢复跨任务域和模型系列的大部分全数据 OPD 增益。我们通过训练期间访问的状态以及学生与老师的一致率来解释这个结果。我们测量\emph{状态覆盖率},即查询集的采样轨迹所达到的状态全数据 OPD 访问的比例。单个查询已达到 \(71.5\%\),其中大部分在前 100 步内。添加语义上不同的查询可以同时提高覆盖率和验证准确性,直到 16 个查询达到 \(98.9\%\) 并匹配全数据训练。然而,无论 OPD 是针对一个查询还是针对整个数据集进行训练,对齐速度都会以相似的速度减慢,甚至一组固定的状态也需要数百步才能吸收。因此,OPD 数据过剩但算法匮乏。它的采样轨迹很快就会暴露出广泛的监督,而学生接受这种监督的速度却越来越慢。状态覆盖结果扩展到多教师 OPD,其中每个域 16 个语义不同的查询与全数据 MOPD 匹配。作为进一步的压力测试,轻内容模板和域外 WildChat 查询也接近真实查询基线。因此,任务内容和诱导状态覆盖可能会分开。我们希望这些发现能够指导未来的工作提高 OPD 的步骤效率,并促使人们重新审视其最近在前沿后训练方面取得的成功背后的数据和机制。
