论文

基于偏好的对齐的分组失真保证

Groupwise Distortion Guarantees for Preference-Based Alignment

模型训练偏好优化

摘要

基于偏好的对齐方法,例如来自人类反馈的强化学习 (RLHF) 和来自人类反馈的纳什学习 (NLHF) 聚合成对偏好以学习LLM策略,但自然目标是最大化社会福利(平均基数效用),仅通过比较不需要确定这一目标。 Gölz、Haghtalab 和 Yang (GHY) 通过扭曲来衡量差距:最佳固定彩票的福利(响应的分布)与学习彩票的福利之间的最坏情况比率。他们表明,当每个用户收到相同的彩票时,NLHF 是最佳的。然而,基于帐户的LLM拥有有关其用户的信息,并且可以为不同的人提供不同的彩票。我们给出了一种有效的算法 GLHF,它可以从每个用户的一次比较中学习单个组条件的策略。在单独的 Bradley-Terry 比较下,GLHF 在预先指定的、可能重叠的集合中的每个组上同时渐近匹配 GHY 的最佳总体畸变界限,样本复杂性随组数呈对数增长,并与最小组质量成反比。当成员分享可行的最喜欢的反应时,对具有相似偏好的群体的更明确的保证接近于扭曲。在使用人类咖啡评分和LLM生成的合成评分的实验中,GLHF 降低了每个评估组的失真,并相对于 NLHF 和其他与组无关的基线显着减少了最差组的失真。