论文
奖励模型的可控文化偏好优化
Steerable Cultural Preference Optimization of Reward Models
摘要
大语言模型 (LLM) 技术必须以每个社区都能接受的方式为许多不同的文化子社区提供服务。然而,迄今为止,对 LLM 对齐的研究主要集中在预测来自某些区域的注释者的统一响应偏好。本文旨在推动具有更全球化视野的对齐模型的开发,该模型能够准确地代表子社区的偏好,并且不会对其中任何一个表现出过度的偏见。为此,我们专注于奖励模型的开发,并提出了一种新颖的奖励 模型训练 算法(SCPO),该算法可以平衡地融合不同的文化偏好。我们的方法使跨 PRISM 和 GlobalOpinionQA 两个数据集以及 7 个国家/地区的少数群体奖励模型的性能比基准模型提高了 7 个点。 SCPO 的训练数据效率比奖励模型的全数据微调高出 280%。此外,我们通过单独评估子社区的偏好来进行偏差分析,并表明通过我们的加权方法可以减轻过度偏差。我们的代码位于 https://github.com/minsik-ai/Steerable-Cultural-Preference