论文
通过偏好维度扩展解释并突破安全-有益性上限
Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion
摘要
在大语言模型多目标对齐领域,平衡不同的人类偏好往往表现为零和冲突。具体而言,相互竞争的目标之间存在内在张力,使得对某一指标(如有益性)的激进优化常常对另一指标(如无害性)造成大幅损失。已有工作主要关注训练期间的数据选择、参数合并或算法平衡,这些方法只是在固定的帕累托前沿上强行折中相互分歧的偏好,未能从根本上化解这一固有权衡。本工作从多维奖励的新视角切入该问题。通过扩大模型的rollout规模并跨不同奖励维度分析输出,我们得出一个关键结论:多目标之间的冲突源于提示本身在固有地限制可达到的多维奖励。基于这一核心观察,我们提出MORA:Multi-Objective Reward Assimilation(多目标奖励同化)。具体而言,MORA通过预采样分离出单一奖励提示,并通过改写原始问题以融入多维意图来扩展其奖励多样性。大量实验表明:(1) 在有益、无害和真实三个维度上完成多偏好对齐后,序列对齐中MORA取得5%到12.4%的单偏好提升,其中无害性收益尤为突出。(2) 在同时对齐中,MORA取得平均4.6%的整体奖励提升。代码发布于 https://github.com/Shiying-Huang/MORA-MPA。
