论文
通过对等成功和失败进行多次采样轨迹 同策略 蒸馏
Multi-Rollout On-Policy Distillation via Peer Successes and Failures
摘要
大语言模型 通常使用稀疏验证者奖励进行后训练,这表明采样轨迹是否成功,但对推理成功或失败的位置提供有限的指导。 同策略 蒸馏 (OPD) 通过对学生生成的轨迹进行训练来提供更密集的 词元级 监督,但现有方法通常独立地提取每个 rollout,并忽略针对同一提示采样的其他尝试。我们引入了 Multi-Rollout 同策略 蒸馏 (MOPD),这是一种同伴调节的 蒸馏 框架,它使用学生的本地 Rollout 组来构建信息更丰富的教师信号。 MOPD 为教师提供了成功和失败的同伴展示的条件:成功为有效推理模式提供了积极的证据,而失败则为需要避免的看似合理的错误提供了结构化的消极证据。我们研究两种同伴情境结构:积极的同伴模仿和对比性的成功失败条件反射。关于竞争性编程、数学推理、科学问答和工具使用基准的实验表明,MOPD 持续优于标准 同策略 基准。进一步的教师信号分析表明,混合的成功与失败环境可以更好地使教师分数与验证者奖励保持一致,这表明收益来自于更忠实、适应实例的监督。这些结果表明,有效的 同策略 蒸馏 应该利用学生的多次采样轨迹试错行为,而不是将采样轨迹视为孤立的样本。