论文

揭秘贪婪对齐方法的不合理有效性

Demystifying the Unreasonable Effectiveness of Greedy Alignment Methods

模型训练偏好优化

摘要

基于 Bradley-Terry 奖励模型拟合和 KL 正则化对齐的贪婪 AI 对齐方法在离线和在线偏好学习管道中都非常有效,但现有的 O(log T) 在线和 O(1/epsilon) 离线 KL 正则化后悔率保证相对于其经验表现来说似乎很悲观。我们认为这种不匹配反映了两个学习目标之间的区别:KL 正则化遗憾衡量我们恢复 KL 正则化对齐策略的速度,而我们通常只问我们能多快学习引起正确最佳响应的奖励函数。为了隔离这个奖励学习组件,我们研究了传统的温度零后悔标准,该标准仅评估推理时排名最高的响应。在可实现性、紧凑性和拟合奖励类别上统一的最佳响应裕度下,我们证明了精确参考记录的离线 RLHF 实现了指数级小的预期温度-零后悔,因此通过 O(log(1ε)) 离线比较在最大 epsilon 处达到了预期后悔。我们还证明了精确贪婪在线 RLHF 实现了有界 O(1) 累积温度-零遗憾;同样的保证也适用于其等效的成对在线 DPO 公式。通过将选择器识别与完全软策略恢复分开,我们的结果为贪婪对齐的经验效率提供了更清晰的理论解释。