论文

稀疏专家混合奖励模型学习可解释的专业专家以进行个性化偏好建模

Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

摘要

偏好建模在人类反馈强化学习 (RLHF) 中发挥着核心作用,使 大语言模型 (LLM) 能够与人类价值观保持一致。然而,大多数现有方法假设通用奖励函数,忽略了人类偏好的多样性和异质性。为了在不增加注释成本的情况下解决这一限制,最近的工作提出从二进制数据中学习多个偏好组件,并将它们组合起来对个人偏好进行建模。然而,这些组件通常无法捕获连贯和解开的模式,限制了它们的可解释性和个性化的有效性。在这项工作中,我们提出了一种稀疏专家混合(MoE)奖励模型,该模型在二元偏好数据的训练过程中鼓励稀疏路由和专家多样性。通过受控和现实世界的实验,稀疏 MoE 学习可解释的路由模式和专业专家。它还改进了测试时的个性化,并且专家权重的适应后变化为分析模型如何适应个性化偏好提供了定性视角。