论文

通过群体去偏联邦学习重新思考偏好异质性下的 LLM 个性化奖励建模

Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

模型训练奖励建模与过程监督

摘要

大语言模型 通过奖励模型越来越符合人类偏好,但用户偏好数据很敏感,通常无法集中。联邦学习将此类数据保留在本地,同时学习共享的初始奖励模型,该模型随后通过本地 微调 为每个客户进行个性化。由于用户经常为同一对响应分配相反的标签,因此现有的联合方法通过对相似的客户端进行聚类并为每组训练一个奖励模型来解决偏好异质性,假设每个组都需要自己的初始化。我们证明这个假设是不必要的。在平衡偏好组下,单个 FedAvg 模型尽管以几乎随机的精度开始,但仅经过几个局部优化步骤就超过了为每个 真值 组单独训练的奖励模型。我们将这种现象归因于共享初始化的平坦性:对所有客户端进行平均可以学习更丰富的共享表示,这些表示可以区分响应,同时取消冲突的偏好方向,使模型接近可以快速适应的决策边界。群体失衡打破了这种效应,因为取消变得不对称,并使少数客户距离边界太远而无法恢复。受这一观察的启发,我们提出了 FedGD(带有群体去偏的联合学习),它在联合训练期间发现潜在的偏好群体,并使用群体去偏客户抽样来学习单一奖励模型。通过抵消群体不平衡的影响,FedGD 学习了一种保持高度适应性的初始化,从而无需事先了解底层群体即可实现有效的个性化。