论文
推理时Nash对齐
Inference-Time Nash Alignment
摘要
基于偏好的微调方法(例如 RLHF 和 DPO)需要大量计算和大型偏好数据集。他们还需要直接访问许多最先进模型所不提供的模型参数。推理时间对齐提供了一种经济高效的替代方案,无需更新模型参数。然而,现有的推理时间方法依赖于 Bradley-Terry 假设下导出的标量奖励模型,该模型无法代表一般偏好。继最近关于广义偏好微调的工作之后,在这项工作中,我们启动了一般偏好下的推理时间对齐的研究。我们将问题表述为获取政策之间两人零和博弈的纳什均衡。我们提出两种算法:纳什最佳算法(BoN)和纳什镜像下降法(NMD)。我们证明两种算法都实现了与问题下界相匹配的对偶间隙。根据经验,我们在三个数据集上实现了这两种方法,这表明我们的方法大大优于基本策略,收敛到微调模型的性能。此外,我们的结果表明 NMD 在正则化参数上仍然保持稳健。