论文
偏好平均导致 RLHF 程序公平失败
Procedural Fairness Failures in RLHF from Preference Averaging
摘要
人类反馈强化学习 (RLHF) 将异质偏好聚合到单个奖励模型中,假设偏好同质性。当偏好存在异质性时,这种聚合会导致程序公平性失败,其中多数偏好群体主导奖励学习,而少数偏好则系统性地代表性不足。这项工作将程序公平性定义为在奖励建模期间保留不同的偏好信号,并表明标准 RLHF 通过偏好平均违反了这一点。引入了偏好感知 RLHF (PA-RLHF),在奖励学习阶段将偏好模式的优化分开。在受控设置中,PA-RLHF 将整体对齐准确度从 46.9% 提高到 67.9%,并将最佳对齐组和最差对齐组之间的公平性差距从 15.9 个百分点减少到 9.6 个百分点。这些结果表明,即使在受控、无噪声的环境中,奖励学习中的结构设计选择也可能导致程序公平性失败,这对 大语言模型 和代理系统有直接影响,在这些系统中,有偏见的奖励模型可能会加剧顺序决策中的不平等。