论文

S-SPPO:语义校准的自博弈偏好优化

S-SPPO: Semantic-Calibrated Self-Play Preference Optimization

模型训练偏好优化

摘要

通常通过直接偏好优化 (DPO) 来制定大型语言模型 (LLM) 与人类偏好的匹配。然而,DPO 的标准 Bradley-Terry 实例化在模拟人类偏好中与传递性的常见偏差方面受到限制。为了解决这个问题,最近的工作引入了自我对弈偏好优化(SPPO),它通过对自我生成的输赢对进行训练来迭代地完善策略。然而,我们的调查揭示了 SPPO 的一个严重的不稳定性:当偏好预言机将过于自信的胜利分配给语义上无法区分的响应时,优化很容易出现策略退化。为了缓解这个问题,我们提出了 S-SPPO,一种双空间语义校准框架,包括: i)通过语义门控进行监督校准,随着语义重叠的增加,将获胜率目标退火到最大熵基线; ii) 通过潜在排斥进行表示校准,以强制几何多样性,以防止流形崩溃并保持所选样本和拒绝样本之间的潜在多样性。从理论上讲,我们表明校准保留了常和博弈结构,有助于收敛到纳什均衡。根据经验,S-SPPO 避免了先前方法中出现的性能下降,在使用 Llama-3-8B 的 AlpacaEval 2.0 上实现了 52.19% 的胜率和 47.46% 的长度控制胜率,而无需在训练期间使用额外的人工注释偏好。该代码可在 https://github.com/xiwenc1/s-sppo 上获取。

S-SPPO:语义校准的自博弈偏好优化:论文配图
图 2:S-SPPO 和 SPPO 主要在偏好优化目标上有所不同,如阴影框(左)所示。偏好边际 |ℙ^​(𝐲≻πt|𝐱)−0.5||\widehat{\mathbb{P}}(\mathbf{y}\succ\pi_{t}|\mathbf{x})-0.5| SPPO 中的偏好边际未经校准,而 S-SPPO 通过输赢对之间的语义相似性 (S)(S) 来校准偏好边际(右)。更多详细信息,请参见附录 C.1。