论文

通用模型:多目标可控语言模型

One Model for All: Multi-Objective Controllable Language Models

模型训练偏好优化

摘要

将大语言模型(LLM)与人类偏好保持一致对于增强LLM的安全性、帮助性、幽默性、忠实性等至关重要。当前的人类反馈强化学习(RLHF)主要侧重于从平均人类评分中学习到的固定奖励,这可能会削弱不同偏好的适应性和可控性。然而,创建个性化的 LLM 需要将 LLM 与个人偏好保持一致,这并非易事,因为每个用户的数据稀缺,而且多目标权衡中用户偏好的多样性,从在某些情况下强调同理心到在其他情况下要求效率和精度。我们能否训练一个 LLM 来根据 Pareto 前沿的不同用户偏好生成个性化输出?在本文中,我们引入了多目标控制(MOC),它训练单个 LLM 直接在 Pareto 前沿的偏好定义区域中生成响应。我们的方法将多目标优化(MOO)原理引入 RLHF 中,以将 LLM 训练为偏好条件策略网络。我们通过在策略层面应用 MOO 来提高 MOC 的计算效率,使我们能够在单个 A6000 GPU 上微调 7B 参数模型。大量实验证明了 MOC 在三个方面相对于基线的优势:(i)LLM 输出的可控性。用户对多种奖励之间权衡的偏好; (ii) LLM 输出的质量和多样性,通过实现的多个解决方案的超量来衡量; (iii) 对看不见的偏好的概括。这些结果凸显了 MOC 在需要可扩展和可定制 LLM 的实际应用中的潜力。