论文
通过不确定性校准多教师恢复一般能力 同策略 蒸馏
Recovering General Capabilities via Uncertainty-Calibrated Multi-Teacher On-Policy Distillation
摘要
将 大语言模型 专门针对垂直领域可以改善特定领域的行为,但通常会降低一般功能。我们在多教师 同策略 蒸馏 (MOPD) 中研究这种权衡,其中专门模型根据自己的采样轨迹向领域教师和普通教师学习。标准 MOPD 面临两个限制:普通的 同策略 采样很少会暴露具有较大正向教师-学生优势的标记,并且优势符号本身并不能确定所提出的更新方向是否可靠。我们提出了不确定性校准 MOPD (UCMOPD),它通过两种互补机制解决了这些限制。Golden-Gain Enhancement(高收益轨迹增强)将较高温度探索与标准温度锚点相结合,并保留其正学习信号匹配或超过特定提示锚点的轨迹。然后,教师认可过滤使用中心对数似然 (CLL) 来估计每个保留标记相对于教师不确定性的合理性,并在概率上保留其方向受该认可支持的更新。在角色扮演和医疗领域专业领域,UCMOPD 比标准 MOPD 的一般能力平均值分别提高了 $4.48\%$ 和 $7.86\%$,同时保持垂直领域性能。组件消融和诊断分析支持两种机制的预期作用:在轨迹级别暴露和选择更强的正信号,并通过 词元级 的教师认可来验证更新方向。