论文

$f$-散度正则化 RLHF:抽样和统一分析的两个故事

$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

模型训练强化学习

摘要

来自人类反馈的强化学习 (RLHF) 已成为 后训练 大语言模型 的基石技术。虽然大多数现有方法依赖于反向 KL 正则化,但最近的实证研究已经开始探索替代散度(例如正向 KL、卡方)作为 RLHF 的正则化器。然而,对一般 $f$ 散度正则化的统一理论理解仍未得到充分探索。为了填补这一空白,这项工作为在线 RLHF 开发了一个全面的理论框架,具有通用的 $f$-divergence 正则化目标。我们没有单独处理每个可能的散度函数,而是对整个函数类采用整体视角,并提出两种基于不同采样原则的算法。第一个方法通过精心设计的探索奖励扩展了经典乐观原则,而第二个方法则引入了一种新方法,该方法利用最优策略的敏感性来奖励$f$-散度正则化下的扰动。理论分析表明,$O(\log T)$ 遗憾和 $O(1/T)$ 次优差距是可以实现的,建立了两种算法的可证明效率,并且据我们所知,在线 RLHF 在一般 $f$ 散度正则化下的第一个性能界限。