论文

无偏答案级别的广义分布对齐游戏 微调

Generalized Distributional Alignment Games for Unbiased Answer-Level Fine-Tuning

模型训练偏好优化

摘要

分布对齐博弈框架为答案级别 微调 (ALFT) 提供了强大的变分视角。然而,这些游戏的标准算法依赖于估计小批量的对数奖励,由于詹森不等式会引入系统偏差,从而破坏训练的稳定性。在本文中,我们系统地解决了这种结构性估计偏差。首先,我们将对齐博弈推广到任意 Bregman 散度,表明对于一系列引发多项式奖励的几何图形,我们可以使用 U 统计量构建可证明精确且无偏的估计量。其次,对于不可能获得精确解的典型 KL 散度博弈,我们推导了一个全局鲁棒的极小极大多项式估计器,该估计器可证明是最优的,实现了我们通过 Ditzian-Totik 定理建立的基本统计误差限制 $θ(1/K^2)$。最后,我们综合这两种方法,提出了一种新颖的方差最优增强多项式优化程序(AQP)估计器,证明通过系统地减少方差,我们的方法不仅实现了最优偏差,而且还加速了游戏收敛,从而以零在线计算开销实现更高效、更稳定的训练。