论文
MINT:面向均衡多目标对齐的最小项选择偏好蒸馏
MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment
摘要
让语言智能体同时对齐多个目标是基于偏好训练的一个顽固失败模式:当多个目标以加法方式组合时,优化会塌缩到最容易改进的目标上并牺牲其余目标,于是一个情感支持智能体学会了语气温暖却不提供真正帮助。根本问题在于加法奖励没有均衡的概念。我们提出Mint(MIN-selection preference disTillation),这是对偏好蒸馏的一行改动:不再按奖励加权和为采样候选排序,而是按其最弱目标排序,在DPO目标不变的情况下蒸馏最均衡的候选而非最失衡的候选。这是覆盖从加法选择到最坏情况选择的广义平均族在p趋于负无穷时的极限。在合作式情感支持与对抗式谈判两个场景中,最小项选择同时提升两个目标并大幅削减其失衡度;在情感支持任务上,它将较弱轴从0.37提升到0.64(p < 10^-40),超越人类专家,并在完整多轮推演中持续保持。逐轮分析得到我们的核心发现:最小项选择按参考策略失衡的程度成比例地纠正失衡,且其收益在交互中持续的时间恰好与该失衡持续的时间一样长。
