论文

CroCo:自我生成的跨语言对比偏好调整

CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations

模型训练偏好优化

摘要

先前的工作表明,通过奖励分数设置的 大语言模型 自生成响应之间的控制对比可以改善英语的下游偏好调整。我们将此方法扩展到多种语言,并在一组不同的任务上评估总共 14 种高资源和低资源语言的两个模型。我们的主要发现是,跨语言对比偏好调整在自生成(CroCo)传输上无需特定于语言的偏好注释。根据英语偏好(在多语言基础上)训练的奖励模型可以在大多数语言中产生有用的语言内排名,并且单语或多语言设置中的配对可以在大多数设置上改进每个模型,同时防止监督 微调 的灾难性遗忘。我们观察到增益需要 同策略 数据。 离策略 响应会降低收益,并且在线偏好优化无法比离线变体有所改善。具体来说,在结构化任务上,我们的方法匹配或超过了 EuroLLM-9B 的 6/7 语言设置和 Aya-3B 的 4/7 设置。在由两名评委评估的开放式生成中,两个经过调整的模型在 15 种评估语言(高资源和低资源)中相对于各自的基础赢得了 28/30 次。总的来说,我们展示了使用自我生成进行多语言偏好调整的有希望的方向。