论文

同策略蒸馏中,提示覆盖范围与采样轨迹更新相互影响

Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation

模型评测模型行为与机制分析

摘要

同策略蒸馏(OPD)需要多少提示?答案如何取决于生成训练回答的学生策略?本文联合研究提示覆盖范围与采样轨迹更新。在3×3数学推理实验中,固定14080条轨迹和110次优化器更新,改变提示库大小以及用于生成回答的策略快照数量。使用十个策略快照时,八个提示达到24.09%的平均准确率,接近14080个不同提示的24.51%。然而,回答冻结在初始策略时,扩大提示范围使准确率从21.16%降至19.05%;每次更新后重新生成回答时,扩大范围则使准确率从23.61%增至25.57%。二者交互效应为4.07个百分点,按问题配对的95%区间为[2.00,6.28]。在两个教师模型下的匹配比较中还出现另一种排名反转:定期更新回答的模型在较短输出预算下准确率和答案完成率更高,但在32K输出限制下,冻结回答训练的模型平均准确率反而更高,同时使用1.7至1.8倍回答词元。这说明OPD中的提示数据效率同时取决于轨迹更新方式和推理预算。