论文
同策略蒸馏中的 Best-of-N 教师轨迹选择
On-Policy Distillation with Best-of-N Teacher Rollout Selection
摘要
同策略 蒸馏 (OPD) 监督学生自己的采样轨迹,它已成为一种数据高效的 后训练 方法,用于改进推理,同时避免强化学习的奖励依赖性和标准监督 微调 中经常观察到的灾难性遗忘。然而,标准 OPD 通常在学生生成的嘈杂环境下计算教师监督,并且通常依赖于每个提示的单个随机教师采样轨迹。因此,监督信号可能是高方差的:采样的教师轨迹可能不正确、信息不足或与学生当前的推理行为不匹配。为了解决这个限制,我们提出了 BRTS,这是 同策略 蒸馏 的 Best-of-N Rollout 教师选择框架。 BRTS 通过根据策划的教师轨迹构建的教师情境监督分支来增强标准学生情境 OPD。 BRTS 不是从第一个采样的教师采样轨迹中提取,而是对一小部分教师轨迹进行采样,并使用简单的优先级规则选择辅助轨迹:正确性第一,学生对齐第二。当有多个正确的教师轨迹可用时,BRTS 选择最符合学生当前行为的一个;当无条件教师样本在更难的提示上失败时,它会调用 真值 条件恢复步骤来引发自然推导。然后,所选轨迹用于在 OPD 循环内提供可靠的教师上下文监督,并通过教师轨迹上的辅助损失进行增强。 AIME 2024、AIME 2025 和 AMC 2023 上的实验表明,BRTS 在具有挑战性的推理基准上比标准 OPD 有所改进,在较难的数据集上收益最大。我们的代码可在 https://github.com/BWGZK-keke/BRTS 获取。