论文

耦合校准和学习:在没有目标领域奖励反馈的情况下减轻大语言模型蒸馏中的教师偏见

Coupled Calibration and Learning: Mitigating Teacher Bias in LLM Distillation without Target-Domain Reward Feedback

摘要

大语言模型(LLM)蒸馏旨在将强大教师的能力转移给较小的学生。然而,直接模仿也可能转移老师的系统性偏见和错误。当教师对目标问题的可靠性不确定并且目标域奖励反馈不可用时,这种挑战在协变量转变下尤其明显。我们提出耦合校准和学习(CCL),这是一种大语言模型蒸馏算法,通过标记级分支将教师校准与学生更新结合起来,仅对源问题使用奖励反馈。每次迭代都会使用源反馈来校准教师,然后使用校准后的教师来训练学生解决目标问题。更新后的学生反过来会通知后续校准。在自回归策略框架中,我们证明输出学生与预言学生的预期平均 Kullback-Leibler 散度以迭代次数的多项式速率收敛到零。预言机最大化学生班级内真正的参考正则化目标奖励,这不需要代表无限制的最优策略。我们的分析量化了预计学生梯度更新的进度,同时控制了教师校准的误差。我们进一步建立了与正则化直接匹配的分离:即使教师实现了比每个学生策略更高的正则化目标奖励,其相对于预言机学生的误差也可以保持在远离零的范围内。这些结果表明,LLM 蒸馏可以克服持续存在的教师偏见,并通过耦合校准和学习来恢复最佳学生,而无需目标域奖励反馈。