论文
面向通用能力恢复与领域保持的抵消感知多教师在线蒸馏
Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation
摘要
领域专业化可以改善大语言模型(LLM)在垂直领域中的表现,但往往会削弱其从原始模型继承的通用能力。近期的多教师在线蒸馏(Multi-Teacher On-Policy Distillation, MOPD)流程通过教师反馈监督学生生成的轨迹来恢复模型能力,但通常假设提示词覆盖与教师对齐,即要求提示词匹配教师的训练分布。当通用教师是后训练数据未知的开源模型时,这一假设难以满足。我们不试图重构这一隐藏分布,而是利用易于获得的代理通用提示词研究通用能力恢复。在这种覆盖不完整的情形下,我们识别出原始MOPD的两种失败模式:一是恢复与保持的相互抵消,源于混合相互冲突的恢复梯度与保持梯度;二是弱信号抹平,源于对纠正需求不等的样本进行均匀平均。我们提出抵消感知多教师在线蒸馏(Counteraction-Aware Multi-Teacher On-Policy Distillation, CaMOPD),通过解耦的交替训练与基于差距的样本选择来解决这些问题。CaMOPD为通用恢复提供专门的更新,定期审视领域提示词以做保持,并选择平均token级师生对数概率差距更大的样本以集中纠正信号。在角色扮演对话与医学推理问答场景中,CaMOPD的通用能力恢复优于各基线,同时保持领域特定行为。梯度一致性分析进一步支持了CaMOPD在产生更一致纠正信号方面的预期效果。
