论文

哪个专家教哪个Token?验证器门控的多专家同策略蒸馏

Who Teaches Which Token? Verifier-Gated Multi-Expert On-Policy Distillation for Scientific Reasoning

模型优化模型训练强化学习蒸馏RLVR

摘要

多教师同策略蒸馏OPD正成为整合专长到单一模型的常用方式:先用强化学习训练专家,再在学生自身轨迹上蒸馏。现有做法按序列分配监督,每提示对应一个领域教师、每token同权,隐含教师对整个回答均匀有用。我们发现有效教师信号沿推理轨迹稀疏且异质,因而提出更细问题:谁教哪个token?VG-OPD通过验证回答:专家对某答案标准的反事实增益决定其教学资格,与学生的分歧定位监督,标准重要性决定权重;门控KL作为附加token级优势进入GRPO。以强化学习训练的能力专家用于科学推理时,VG-OPD在4B和8B学生的七个基准上取得最佳整体表现,两种规模均有五项第一,知识密集科学推理增益最大。分析显示,收益来自定位经验证监督,而非增加教师或蒸馏损失;同样监督预算放错位置是破坏最大变化,无差别蒸馏使强化学习低于自身基线,门控蒸馏则提升。

哪个专家教哪个Token?验证器门控的多专家同策略蒸馏:论文配图
图1:由谁监督哪个Token?在一条782 Token的学生轨迹上,MOPD由单一领域教师密集监督,VG-OPD则选择性分配专家,将监督集中在专家与学生意见不同的Token上。该例中证据专家仅监督部分Token,颜色越深表示监督越强。