论文
多语言 LLM 对齐的元学习首选项
Meta-Learning Preferences for Multilingual LLM Alignment
摘要
跨语言的人类偏好数据的可用性不平等对在多语言环境中对齐 大语言模型 提出了重大挑战。为了解决低资源语言对齐中缺乏足够数据的问题,我们提出了一个元学习框架,用于从人类反馈和直接偏好优化中进行强化学习。通过利用其他语言的偏好数据,我们的框架学习可转移的初始化,从而能够以最少的数据有效适应目标语言。我们为元奖励建模和元策略优化设置提供了理论保证,并凭经验证明了我们的方法在多语言基准上的有效性。在只有 100 个目标语言偏好样本的资源极少的环境中,我们的方法比基线方法实现了高达 28\%$ 的胜率改进,并且在多个目标语言和模型规模上始终优于基线。我们的方法在元训练语言的不同组合以及与目标语言的不同语言距离中保留了这些优势。