论文

IRIS:跨语言数学推理的增量阶段课程的交错强化

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

模型训练强化学习

摘要

课程学习通过逐渐增加任务难度来帮助语言模型处理复杂的推理。然而,它通常无法生成一致的逐步推理,特别是在多语言和资源匮乏的环境中,从英语到印度语言的跨语言迁移仍然有限。我们提出了 IRIS:渐进分阶段课程的交错强化,这是一个两轴框架,它将针对逐渐困难的问题(纵轴)的监督 微调 与逆向课程强化学习相结合,以减少对逐步指导(横轴)的依赖。我们设计了一种综合奖励,结合了正确性、逐步调整、连续性和数字激励,并通过组相对策略优化(GRPO)进行优化。我们发布了 CL-Math,这是一个包含 29k 个问题的数据集,带有英语、印地语和马拉地语的步骤级注释。在标准基准和策划的多语言测试集上,IRIS 不断提高性能,在数学推理任务上取得了强劲的成绩,在资源匮乏和双语环境中取得了显着的进步,同时在资源丰富的语言方面也有了适度的改进。