论文

偏好不确定性下的鲁棒纳什对齐

Robust Nash Alignment under Preference Uncertainty

模型训练偏好优化

摘要

基于偏好的对齐方法通常针对单个偏好模型进行优化,因此当成对偏好不确定时(噪声、异质或部署后的变化),可能会很脆弱。为了解决这些问题,我们提出了鲁棒纳什对齐,这是一种博弈论框架,用于对齐不确定的成对偏好。我们的公式有一个主要的学习者寻求一种策略,该策略对于对抗性竞争对手和围绕名义偏好设置的模糊性中的任何偏好内核都具有较大的最坏情况获胜率。当模糊集捕获偏好的不确定性时,由此产生的稳健的游戏目标将直接产生经过认证的最坏情况性能下限。然而,我们注意到这个问题在计算上很难优化,为了解决这个问题,我们引入了一种四人原始对偶代理游戏,涉及领导者策略、追随者策略、对抗内核和对偶变量,并为其开发了一种单循环乐观镜像下降-上升算法。我们表明,代理总是对截断的硬约束目标进行下限,量化代理与硬的差距,并描述代理恢复鲁棒目标的精确性条件。然后,我们证明代理博弈对偶差距的\(\mathcal{O}(1/\sqrt{T})\)平均迭代收敛性,这意味着原始稳健目标的近乎最优的稳健策略。受控表格游戏和具有不确定偏好的 LLM 对齐的实验进一步验证了收敛理论,并显示出相对于名义基线的改进性能。