论文

PAFO:面向个性化奖励建模的帕累托公平优化

PAFO: Pareto Fairness Optimization for Personalized Reward Modeling

模型训练奖励建模与过程监督

摘要

大型语言模型 (LLM) 越来越依赖奖励模型来使其输出与不同的用户偏好保持一致。虽然个性化奖励模型旨在捕捉这种异质性,但它们通常是根据不平衡的用户偏好数据进行训练的,因此可能会偏向在训练人群中偏好更常见的用户。在本文中,我们将这种失败模式识别为个性化奖励偏差,其中奖励建模质量随偏好支持率系统性地变化。我们将其缓解措施制定为群体公用事业上的帕累托公平问题,旨在改善服务不足的用户而不降低其他用户群体的质量。为此,我们提出了 PAFO,一种用于个性化奖励建模的帕累托公平优化框架。 PAFO 首先为多数和少数偏好群体训练专门的奖励模型,然后构建条件边际水平监督,将其异质偏好边界提炼为单一的统一模型。生成的模型仅在训练期间使用组信息,并且在推理时不需要明确的组标签。 Personal-LLM 和 DSP 上的实验表明,PAFO 提高了少数群体和多数群体的准确性,同时减少了多个指标中用户级别的不公平性,证明了其对更公平的 LLM 个性化的有效性。

PAFO:面向个性化奖励建模的帕累托公平优化:论文配图
图 1:即使在个性化 RM 下,少数用户的奖励预测准确度也明显低于大多数用户。