论文

超越提示数量:数据形状如何在策略蒸馏中传输

Beyond Prompt Count: How Data Shapes Transfer in On-Policy Distillation

模型评测模型行为与机制分析

摘要

在on-policy蒸馏(OPD)利用教师对自己抽样回答的反馈来训练学生,但提示选择形状如何在师生对之间传递仍然知之甚少。我们系统地研究 RL 和 SFT 延续对以及跨模型设置的提示数量、来源和选择。我们发现 OPD 可以具有很高的提示效率:一些提示可以接近大型池的性能,其中四个 DAPO 提示与观察到的 3,840 个 DeepMath 提示的数学分数相匹配。然而,提示效用是相关的而不是内在的:仅改变老师就可以扭转数学和代码提示的相对有效性。为了表征这些传递差异,我们分析了提示支持和模型对之间的参数和功能变化。与教师的功能协调因支持和目标任务而异;在连续对中,教师对齐的预测更改可以与弱参数对齐共存。在有效支撑上持续进行 OPD 可以在不利的转移后恢复性能。最后,有针对性的选择并不总是优于均匀随机抽样,并且过滤掉单独表现不佳的源不会在三对支持抽取中产生一致的增益。总的来说,我们的结果区分了即时效率和即时互换性,并表明有效的数据选择取决于师生配对和目标能力,随机抽样在研究环境中提供了有竞争力的基线。