论文
学习路由语言以优化多语言策略
Learning to Route Languages for Multilingual Policy Optimization
摘要
大语言模型~(LLM)是在异构多语言语料库上进行训练的,但现有的策略优化方法通常隐式地将每个训练问题限制为单一响应语言或依赖于固定的主导语言进行监督。我们提出了语言路由策略优化(LRPO),这是一种将语言视为可选变量的在线策略优化框架。 LRPO 为每个训练问题引出多语言推广,并将其相对质量整合到基于偏好的政策更新中,从而在固定推广预算下增加训练信号的多样性和信息量。为了自适应地确定强化学习期间要探索的语言,我们引入了一种可训练的语言路由器,其被制定为多臂老虎机,平衡对未充分利用的语言的探索与对信息更丰富的语言的利用。大量实验表明,LRPO 持续提高多语言性能,证明自适应语言路由能够有效地利用跨语言知识进行训练。我们在 https://github.com/Guochry/LRPO 发布了所有资源。