论文

通过互信息进行多目标探索和偏好优化

Multi-Objective Exploration and Preference Optimization via Mutual Information

模型训练偏好优化

摘要

将 大语言模型 与多样化和异质的人类价值观保持一致需要多目标对齐方法来有效地权衡相互冲突的偏好维度。当前的方法通过训练以偏好向量为条件的策略并利用在线直接偏好优化来实现这种权衡。然而,探索的不确定性会导致在不同偏好向量下生成的响应的奖励分布重叠,并且生成的响应可能无法有效地与相应的偏好向量对齐。在本文中,我们提出了通过互信息进行多目标探索和偏好优化(MI-EPO),这是一种信息理论框架。它通过最大化生成的响应、偏好反馈和偏好向量之间的联合条件互信息来统一多目标探索和对齐。通过结合概率路由机制,MI-EPO 自然地分解了目标对齐和偏好感知探索,鼓励模型生成可区分并与不同偏好条件保持一致的响应。安全对齐和有用辅助任务的实验表明,MI-EPO 显着改善了生成的响应和偏好向量之间的对齐,使输出更加可控,并在多个目标之间实现稳定的权衡。