论文
AdaMame:自适应多语言推理的训练秘诀
AdaMame: A Training Recipe for Adaptive Multilingual Reasoning
摘要
虽然大型推理模型 (LRM) 在英语中表现出强大的性能,但它们通常无法用查询的语言进行推理,这种现象称为语言崩溃。现有的基于强化学习的修复通常会为准确性目标添加二进制语言保真度奖励,但仍然会在准确性、中间跟踪代码切换和过度词元使用方面产生权衡。在这项工作中,我们提出了 AdaMame,这是一种用于多语言数学推理的两阶段训练方法,它通过在不影响准确性的情况下自适应地将推理语言与查询语言对齐来解决这些限制。第一个 SFT 阶段对跨五种语言的非 MT 推理轨迹进行微调,以建立多语言推理能力。在随后的强化学习阶段,我们引入了 AdaMame-GRPO,它是组相对策略优化 (GRPO) 的一种改进,其中查询条件对齐因子在训练过程中逐渐增长,引导模型在利用查询语言中的推理之前首先探索不同的推理语言。通过两个基准、两个 LRM 和 12 种语言进行评估,AdaMame-GRPO 在所有基准上的推理准确性、语言保真度和标记效率方面实现了帕累托最优性能,其中在域外、资源较低的语言上获得了最强的收益。