论文
语言模型多语言推理的跨语言自一致性
Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models
摘要
尽管扩大了多语言覆盖范围,但 LLM 的高级推理能力仍然主要局限于英语等少数高资源语言。为了解决这个问题,我们提出了一种无监督的强化学习(RL)方法,通过强制跨语言的自我一致性来增强多语言推理:模型应该对不同语言的等效问题产生相同的最终答案的原则。现有方法受到多语言推理数据稀缺的限制,并且对未见过的语言的泛化能力较弱。我们的方法既不需要参考答案,也不需要并行数据,它在 10 种语言的 MGSM 上实现了高达 21.7% 的平均收益。此外,我们的方法表现出很强的泛化性,在训练期间未见的 MGSM 语言平均提高了 18.2%,并且在 3 个分布外基准上提高了高达 6.2%。这些结果显示了基于一致性的方法在无需监督数据的情况下提高 LLM 的多语言能力的潜力。