论文

通过位置选择性自蒸馏从语言反馈中训练大语言模型评审

Training LLM Judges from Language Feedback via Position-Selective Self-Distillation

摘要

我们研究根据自然语言反馈来训练大语言模型评审,特别是对于主观任务,其中判决很大程度上取决于评审调用的评估标准以及如何权衡这些标准。占主导地位的方法是结果监督强化学习(例如 GRPO),将rollout中的每个词元都归为仅由最终判决的准确性确定的单个标量,在标准选择词元上不提供单独的信用,并忽略自然伴随偏好标签的丰富语言反馈(例如偏好理由)。自蒸馏(SD)是使用这种语言反馈的一种自然方式:相同的模型,以这种反馈为条件,充当老师,提供密集的、职位级别的监督。然而,并非所有位置都携带同样有用的信号。利用教师和学生之间的每个位置的熵移,我们确定了两种制度:上下文锐化,其中教师将概率集中在特定的反馈对齐标准表达式上,以及上下文扩展,其中教师将概率分布在多个反馈对齐的替代方案中。我们对这些模式的解释如下:锐化鼓励记忆特定的标准表达,而传播则通过保留这些替代方案来促进语义理解。受这种不对称性的启发,我们引入了基于熵位移的位置掩蔽,保留了熵位移分布的下尾部。实验表明,与朴素 SD 相比,屏蔽较高熵位移位置可以提高分布外泛化能力。由此产生的自我提炼的评审在评估的主观子类别上比接受过结果监督强化学习训练的评审高 2-9 个百分点,同时在客观子类别上保持竞争力。