论文
向正确的人学习:针对多域的经过答案验证的多教师 蒸馏 LLM
Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs
摘要
现代 大语言模型 (LLM) 依靠强化学习在各个领域构建强大的功能,但将这些功能集成到单个可部署模型中仍然具有挑战性。通过将每个样本路由到域与其匹配的教师,现有方法让域标签决定哪个教师提供监督。然而,领域专业知识仅适用于平均水平:匹配的教师在给定样本上并不总是正确的,而来自另一个领域的教师有时是正确的。因此,必须根据样本而不是每个领域来确定可靠的老师。在本文中,我们介绍了多教师自我 蒸馏 策略优化(MT-SDPO),这是一种将多个冻结教师统一为一个学生模型的 同策略 蒸馏 方法。 MT-SDPO 由三个部分组成:(1)自锚,其中的采样轨迹由其自己组的正确采样轨迹进行监督; (2) 答案验证资格,即教师只有在自己的答案通过验证者的情况下才可以对样本进行监督; (3) 特权 蒸馏,它将锚点和所有经过验证的反馈合并到指数移动平均自教师阅读而学生不阅读的上下文中,从而在部署时保留一项策略。在来自三个模型家庭的五名学生中,MT-SDPO 将 Qwen3-8B 最弱的领域提升了 14.79 分,并将其领域差距缩小了 74.7%,比每个领域为一名匹配的教师提供更好的平衡。决定谁教的应该是经过验证的可靠性,而不是域成员资格。代码可在 https://github.com/hexifang/MT-SDPO 获取。