论文
模型更小,剔除效果更好:偏好蒸馏缩放
Smaller Models, Better Rejects: Preference Distillation Scaling
摘要
偏好蒸馏通常将教师的响应视为首选,并将学生自己的响应视为拒绝。这假设自我生成的失败是信息量最大的负数,并且拒绝必须来自至少与学生一样大的模型,这使得大规模生成成本高昂。我们发现这两个假设都不成立:在从 7B 到 72B 的学生中,较小的冻结模型以较少的推理计算生成拒绝,但在序列级知识蒸馏之前和之后,在代码生成和数学推理方面训练出比自行生成的拒绝更强大的学生。为了解释这个结果,我们在线性化特征模型中推导了直接偏好优化的有限范围效用界限。该界限表征了有利的拒绝分布并激发了三种干预措施。首先,随着较小模型份额的增加,混合来自较小模型和学生规模模型的拒绝可以提高性能。其次,将拒绝重新分配给其他提示并打乱其代码标记仍然优于长度匹配的乱码,这表明任务结构有助于拒绝效用。第三,当较高可能性的候选者提供不太有用的对比时,在参考策略下选择可能性较低的候选者可以改善净转移。对于每个源,较低似然的选择都优于较高似然的选择。这些结果表明,有效的拒绝保留了任务结构,同时限制了与参考策略的耦合,并且较小的冻结模型可以以较低的成本提供它们。