论文

MINT:面向均衡多目标对齐的最小项选择偏好蒸馏

MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment

模型训练偏好优化

摘要

让语言智能体同时对齐多个目标是基于偏好训练的一个顽固失败模式:当多个目标以加法方式组合时,优化会塌缩到最容易改进的目标上并牺牲其余目标,于是一个情感支持智能体学会了语气温暖却不提供真正帮助。根本问题在于加法奖励没有均衡的概念。我们提出Mint(MIN-selection preference disTillation),这是对偏好蒸馏的一行改动:不再按奖励加权和为采样候选排序,而是按其最弱目标排序,在DPO目标不变的情况下蒸馏最均衡的候选而非最失衡的候选。这是覆盖从加法选择到最坏情况选择的广义平均族在p趋于负无穷时的极限。在合作式情感支持与对抗式谈判两个场景中,最小项选择同时提升两个目标并大幅削减其失衡度;在情感支持任务上,它将较弱轴从0.37提升到0.64(p < 10^-40),超越人类专家,并在完整多轮推演中持续保持。逐轮分析得到我们的核心发现:最小项选择按参考策略失衡的程度成比例地纠正失衡,且其收益在交互中持续的时间恰好与该失衡持续的时间一样长。

MINT:面向均衡多目标对齐的最小项选择偏好蒸馏:论文配图
图2:Mint 在 ESConv 上的表现(静态留出评估)。两个面板均报告留出测试划分(n=406 个智能体轮次,来自 30 段在蒸馏或检查点选择期间从未见过的对话);成就(AQ)与情感(EQ)质量各由一个冻结的 Llama-3.1-8B 评审打分。(a) 基础模型、监督(SFT)基线、Mint 和人类支持者的各目标得分。Mint 在所有基线之上同时改进了两个目标及其最小值 min(AQ, EQ),并缩小了不平衡度 |AQ−EQ|:相对于 SFT,它将 min(AQ, EQ) 从 0.37 提升到 0.64(+0.27 的配对提升;Wilcoxon 符号秩检验 p≈3×10⁻⁴³,在 79% 的匹配轮次上更高)。(b) 同一些策略作为目标空间中的点。基础模型温暖但成就偏低(高 EQ、低 AQ),SFT 温暖不足,人类支持者自身也不平衡;Mint 是唯一朝平衡对角线(AQ=EQ)移动的策略,取得了最高且最平衡的分数,比那些对话记录为该流程提供种子的人类专家更平衡。所有分数均为奖励模型所评估的质量