论文

大语言模型偏好学习的遗憾最小化框架

A Regret Minimization Framework on Preference Learning in Large Language Models

模型训练偏好优化

摘要

带有可验证奖励的强化学习(RLVR)依靠提供自动正确性信号的特定任务验证器,使得推理密集型任务取得了进展。然而,许多现实的语言任务很难配备可靠的验证器,这促使人们越来越依赖人类反馈的强化学习(RLHF)。在这种情况下,我们认为有必要仔细研究如何解释人类反馈。我们引入基于后悔的偏好优化$(\textbf{RePO})$,它通过$\textit{后悔最小化}$而不是奖励最大化来重构RLHF。人类的偏好通常是由对结果的预期和与替代行为的比较决定的,而不是由直接的、与结果无关的效用决定的。 $\textbf{RePO}$ 通过将偏好建模为相对次优的行为条件评估来捕获这种结构。数学推理基准和人类偏好数据集的实验证明了一致的性能增益,表明 $\textbf{RePO}$ 是训练大型语言模型的有效且符合人类需求的方法。

大语言模型偏好学习的遗憾最小化框架:论文配图
图 1:奖励最大化和遗憾最小化推理之间的比较。在奖励最大化中,评估是每一步的局部评估,并且仅取决于即时奖励。相比之下,遗憾最小化执行前瞻性推理,继续前进到可验证的未来状态的轨迹,然后使用实现的结果对早期步骤进行回顾性重新评估。