论文

截断坏的,增加好的:BoN 风格的 蒸馏 通过基于排名的分类

Truncate Bad, Upweight Good: BoN-Style Distillation via Rank-Based Classification

模型训练偏好优化

摘要

推理时间选择方法(例如 Best-of-N)通过对候选池进行采样并根据奖励模型选择排名靠前的完成来改进生成。 蒸馏 试图通过用池内排名替换原始奖励并学习提高排名较高完成度的策略来将此过程分摊到单个策略中。然而,现有的基于排名的策略通常使用平滑的完全支持重新加权,因此排名较低的完成获得的质量较小,但仍保持在目标支持范围内。尽管更剧烈的重新权重会减少尾部质量,但它也会增加对单一奖励模型造成的顶部脆弱排名的依赖。我们提出 TUP:一种截断坏的、增重好的策略,从支持中删除排名较低的完成,并仅对保留的上尾进行重新加权,并具有可调的锐度。 TUP 承认封闭形式、独立于提示的标准化,并且可以通过二元交叉熵完全离线训练,使用移位截断获胜率作为软标签,并使用蒸馏到参考的对数似然比作为 logits。理论上,在某些假设下,我们表明,对于任何未知的预言机奖励,最好的单调排名重新加权可以通过下尾截断规则来匹配,为删除下尾提供正式支持,而不是仅仅降低其权重。根据经验,我们表明 TUP 具有强大的离线对齐基线的竞争力。