论文

超越折中:面向高效多偏好LLM对齐的Pareto-Lenient共识

Beyond Compromise: Pareto-Lenient Consensus for Efficient Multi-Preference LLM Alignment

模型训练偏好优化

摘要

超越单一偏好范式、使LLM与多样的人类价值观对齐,对稳健部署至关重要。当前的多目标偏好对齐(MPA)方法主要依赖静态线性标量化或僵硬的梯度投影来处理这些权衡。然而,由于强制要求严格避免冲突或同步下降,这些范式常常过早收敛到局部驻点。这些点虽然在数学上稳定,却代表一种保守的折中:模型为规避暂时的局部权衡而牺牲了潜在的全局Pareto改进。为打破这一僵局,我们提出Pareto-Lenient Consensus(PLC),一个将对齐重新构想为动态协商过程的博弈论框架。与僵硬的方法不同,PLC引入由共识驱动的宽容梯度修正,只要主导联盟盈余足够,就动态容忍局部性能下降,从而使优化轨迹能够摆脱局部次优均衡,探索远端的Pareto最优前沿。理论分析验证了PLC能够促进僵局逃逸,并渐近收敛到Pareto共识均衡。此外,大量实验表明,PLC在固定偏好对齐与全局Pareto前沿质量上均超越基线。这项工作凸显了协商驱动对齐作为MPA有前景方向的潜力。代码发布于 https://anonymous.4open.science/r/aaa-6BB8。

超越折中:面向高效多偏好LLM对齐的Pareto-Lenient共识:论文配图
图 1:多偏好 LLM 调整的 Pareto Lenient Consensus (PLC) 框架概述。与由于早期梯度僵局而陷入次优风险规避平衡的基线不同(𝟎εConv​{∇Jk}\mathbf{0}\in\rm{Conv}\{\nabla J_{k}\}),PLC 利用基于联盟的宽松过滤来纠正更新方向,成功导航到帕累托前沿。