论文
训练时应选择哪些偏好? 端到端具有对抗性偏好分布的多目标对齐
Which Preferences to Train On? End-to-End Multi-Objective Alignment with an Adversarial Preference Distribution
摘要
将大语言模型 (LLM) 与人类价值观保持一致对于安全、高效和有益的 AI 部署非常重要。然而,人类的价值观是多方面的:乐于助人、无害和幽默相互权衡,不同的用户想要不同的权衡。多目标对齐(MOA)通过训练和策略解决了这个问题,它可以提供 Pareto 前沿的任何点,但现有方法要么根据偏好训练一个模型,事后插入一些单独对齐的专家,要么训练单个条件模型而不考虑应该训练哪些偏好。由于偏好单纯形的困难区域取决于当前的目标,因此现有方法使它们训练不足,并且无法充分利用单个模型。因此,我们提出了 MAESTRO(通过端到端转向和鲁棒优化进行多目标对齐),它将 MOA 表述为偏好分布上的极小极大问题,并针对对抗性偏好分布训练一个带有 RL 的提示条件策略端到端:一种通过在线镜像下降更新的狄利克雷分布,该分布更新为当前策略最差的偏好,而不是固定的偏好。在 HH-RLHF、BeaverTails 和最多三个目标的汇总任务上,MAESTRO 在单次训练运行中的大多数任务上获得了最佳帕累托前沿,并且在比较方法中训练成本最低。最大的利润出现在固定偏好分布未得到充分训练的困难区域,这证实了单个即时条件模型能够自行覆盖客观权衡。