论文

MGDA-解耦:基于 DPO 的 LLM 对齐的几何感知多目标优化

MGDA-Decoupled: Geometry-Aware Multi-Objective Optimisation for DPO-based LLM Alignment

模型训练偏好优化

摘要

使 大语言模型 (LLM) 与理想的人类价值观保持一致需要平衡多个潜在冲突的目标,例如乐于助人、诚实和无害,这提出了多目标优化挑战。大多数协调管道依赖于这些目标的固定分级,这可能会通过系统地低估难以优化或少数目标的权重而引入程序不公平。为了促进更公平的权衡,我们引入了 MGDA-De Coupled,这是一种基于几何的多目标优化算法,可以找到共享的下降方向,同时明确考虑每个目标的收敛动态。与之前依赖于强化学习(例如 GAPO)或显式奖励模型(例如 MODPO)的方法相比,我们的方法完全在轻量级直接偏好优化(DPO)范例中运行。 UltraFeedback 数据集上的实验表明,几何感知方法(尤其是 MGDA 解耦)在总体和每个目标方面都能实现参考响应的最高获胜率。