论文
APPA:LLM 公平联邦 RLHF 的自适应偏好多元对齐
APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
摘要
将 大语言模型 (LLM) 与不同的人类偏好保持一致需要多元对齐,其中单个模型必须同时尊重多个不同群体的价值观。在基于人类反馈的联合强化学习(FedRLHF)中,这些群体在不集中偏好数据的情况下调整共享策略,这使得公平的奖励聚合至关重要。现有的聚合方法表现出明显的权衡:基于平均值的聚合系统地对齐表现最差的组,而最小聚合则以整体对齐为代价优先考虑表现最差的组。我们提出了 APPA,一种自适应偏好多元对齐框架,可根据历史对齐奖励动态重新调整群体级别奖励的权重。我们的方法优先考虑一致的群体,而不降低一致的群体,同时不需要访问原始偏好数据。集成到基于近端策略优化 (PPO) 的 FedRLHF 管道中,并在三个模型系列(Gemma 2 2B、Llama 3.2 3B、Qwen3 0.6B)的 GLOBALQA 和 OQA 上进行评估,APPA 实现了强大的公平对齐权衡,将最差组对齐比平均聚合提高了 28%,同时在大多数配置中保持比最小聚合更高的整体对齐。