论文
大语言模型偏好学习的遗憾最小化框架
A Regret Minimization Framework on Preference Learning in Large Language Models
摘要
带有可验证奖励的强化学习(RLVR)依靠提供自动正确性信号的特定任务验证器,使得推理密集型任务取得了进展。然而,许多现实的语言任务很难配备可靠的验证器,这促使人们越来越依赖人类反馈的强化学习(RLHF)。在这种情况下,我们认为有必要仔细研究如何解释人类反馈。我们引入基于后悔的偏好优化$(\textbf{RePO})$,它通过$\textit{后悔最小化}$而不是奖励最大化来重构RLHF。人类的偏好通常是由对结果的预期和与替代行为的比较决定的,而不是由直接的、与结果无关的效用决定的。 $\textbf{RePO}$ 通过将偏好建模为相对次优的行为条件评估来捕获这种结构。数学推理基准和人类偏好数据集的实验证明了一致的性能增益,表明 $\textbf{RePO}$ 是训练大型语言模型的有效且符合人类需求的方法。
