论文

Meta-Aligner:多目标 LLM 对齐的双向偏好策略优化

Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment

模型训练偏好优化

摘要

多目标协调旨在通过同时优化多个目标,使 大语言模型 (LLM) 与多样化且经常相互冲突的人类价值观保持一致。现有方法主要依赖于静态偏好权重构建策略。然而,严格遵守固定目标会丢弃有价值的中间信息,因为即使偏离目标,训练响应本质上也体现了有效的偏好权衡。为了解决这个限制,我们提出了 Meal,即 MEta ALigner,这是一个双层元学习框架,能够在偏好和政策响应之间进行双向优化,为更稳定的训练生成指导性的动态偏好。具体来说,我们引入偏好权重网络作为元学习器,根据输入提示生成自适应偏好权重,并将偏好权重更新为可学习参数,而 LLM 策略则充当基础学习器,通过拒绝采样策略根据这些偏好优化响应生成。大量的实证结果表明,我们的方法在多个多目标基准上取得了优异的性能,验证了动态双向偏好策略优化框架的有效性。