论文
重新审视人工智能对准的扭曲:RLHF 是一个不错的实用对准器
Distortion of AI Alignment Revisited: RLHF is a Decent Utilitarian Aligner
摘要
虽然人类反馈强化学习(RLHF)是使大型语言模型与人类偏好保持一致的标准范例,但其在多元化环境中的有效性受到质疑。值得注意的是,Gölz 等人最近的工作。 (2025) 证明,当用户具有异质偏好时,\textit{扭曲}(定义为 RLHF 政策的平均用户效用与最优平均效用之间的乘法差距)可以随 Bradley-Terry 温度参数 $β$ 呈指数级扩展。在这项工作中,我们对带有奖励限幅的 RLHF 失真进行了细粒度分析,并证明这种指数退化不是算法的基本属性,而是生成偏好数据 ($μ$) 的分布与 KL 参考策略 ($π_{\mathrm{ref}}$) 之间分布不匹配的结果。为此,我们在 KL 正则化强度的多个机制中建立了 RLHF 失真的严格上限和下限。我们表明,在 Bradley-Terry 模型的代表性情况下,畸变为 $\tildeθ(βB + β)$,其中 $B$ 是 $μ$ 和 $π_{\mathrm{ref}}$ 之间对数密度比的上限。特别是,当不存在分布失配时(即 $μ= π_{\mathrm{ref}}$),RLHF 可以实现 $O(β)$ 的最佳失真直至恒定。我们的结果表明,为了合理地最大化 RLHF 的平均效用,最好使用策略采样偏好数据或在 RLHF 之前对来自接近 $μ$ 的数据源的数据进行微调。