论文

提取您信任的内容:具有可靠性意识的多教师按策略提取

Distill What You Trust: Reliability-Aware Multi-Teacher On-Policy Distillation

摘要

多位教师的政策蒸馏允许学生按照自己的轨迹向互补的专家学习。然而,域路由方法为每个示例选择一名教师,并在整个响应过程中保持固定。这种设计既依赖于混合训练语料库通常缺乏的标签,也无法在轨迹内所需的专业知识发生变化时适应教师的选择。我们提出 \textbf{TrustMOPD},它将示例级教师选择替换为无标签、词元级监督分配。在每个学生生成的前缀中,TrustMOPD 使用每个专家的 RL 引起的相对于共享的 RL 前参考的位移作为本地可靠性的代理,在教师之间校准这些分数,并构建加权蒸馏目标。在数学、代码和指令遵循方面,TrustMOPD 优于最强的无标签基线,将 \textsc{SingleCap} 上的回收率从 $54.4\%$ 提高到 $91.5\%$,将 \textsc{MultiCap} 上的回收率从 $54.5\%$ 提高到 $98.0\%$,同时接近 \textsc{SingleCap} 上基于标签的 MOPD。独立于学生生成的前缀而随机化词元级别权重的效果并不比统一加权更好,这支持了条件监督对不断发展的生成上下文的重要性。