论文

语言链对齐:跨语言排名偏好优化

Language Chain in Alignment: Cross-lingual Ranking Preference Optimization

模型训练偏好优化

摘要

大语言模型 的对齐严重依赖于以英语为中心的高质量偏好数据,这通常会导致其他语言的性能不佳。在本文中,我们提出了跨语言排名偏好优化(CRPO),这是一种新颖的框架,它利用英语中强大的偏好知识来促进目标语言中的偏好对齐。我们在目标语言和英语的并行偏好对中设计了一个层次结构,以共同优化语言内和语言间偏好,从而提高语言适应和输出质量。 CRPO 以 LambdaLoss 框架为基础,通过提供跨多个候选响应的相对排名信号,超越了基于二元比较的优化。我们对五种具有不同资源规模的语言进行的实验表明,CRPO 在指令遵循和知识利用能力方面始终优于标准方法。值得注意的是,在各种加权方案中观察到的稳健性能增益进一步验证了我们的分层设计在多语言设置中的经验有效性。此外,我们的研究结果强调,CRPO 显着提高了奖励裕度和期望响应的对数概率,有助于为跨语言对齐提供更稳定的偏好流形。我们的代码可在 https://github.com/dltmddbs100/CRPO 获取。