论文

TAPO:多语言数学推理的翻译增强策略优化

TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning

模型训练强化学习

摘要

大语言模型 (LLM) 在英语数学推理方面表现出了卓越的熟练程度,但在多语言环境中仍然存在显着的表现差异,这在很大程度上归因于语言理解的缺陷。为了弥补这一差距,我们引入了翻译增强策略优化(TAPO),这是一种基于 GRPO 的新型强化学习框架。 TAPO 强制执行明确的对齐策略,其中模型利用英语作为支点,并遵循先理解后推理的范式。至关重要的是,我们采用了一种阶梯级相对优势机制,将理解与推理分离,允许整合翻译质量奖励,而不会引入优化冲突。大量实验表明,TAPO 有效地协同了语言理解和推理能力,并且兼容各种模型。它在多语言数学推理和翻译任务中都优于基线方法,同时很好地推广到未见过的语言和域外任务。