论文
S-SPPO:语义校准的自博弈偏好优化
S-SPPO: Semantic-Calibrated Self-Play Preference Optimization
摘要
通常通过直接偏好优化 (DPO) 来制定大型语言模型 (LLM) 与人类偏好的匹配。然而,DPO 的标准 Bradley-Terry 实例化在模拟人类偏好中与传递性的常见偏差方面受到限制。为了解决这个问题,最近的工作引入了自我对弈偏好优化(SPPO),它通过对自我生成的输赢对进行训练来迭代地完善策略。然而,我们的调查揭示了 SPPO 的一个严重的不稳定性:当偏好预言机将过于自信的胜利分配给语义上无法区分的响应时,优化很容易出现策略退化。为了缓解这个问题,我们提出了 S-SPPO,一种双空间语义校准框架,包括: i)通过语义门控进行监督校准,随着语义重叠的增加,将获胜率目标退火到最大熵基线; ii) 通过潜在排斥进行表示校准,以强制几何多样性,以防止流形崩溃并保持所选样本和拒绝样本之间的潜在多样性。从理论上讲,我们表明校准保留了常和博弈结构,有助于收敛到纳什均衡。根据经验,S-SPPO 避免了先前方法中出现的性能下降,在使用 Llama-3-8B 的 AlpacaEval 2.0 上实现了 52.19% 的胜率和 47.46% 的长度控制胜率,而无需在训练期间使用额外的人工注释偏好。该代码可在 https://github.com/xiwenc1/s-sppo 上获取。
