论文

Aryabhata 2:以强化学习提升复杂STEM推理

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

模型训练强化学习

摘要

JEE和NEET等竞争性STEM考试要求多步符号推理、精确数值计算,以及对物理、化学和数学的深入理解。大语言模型虽在常见推理基准上表现较好,但面对数百万学生的问题时,仍难以大规模提供符合学科要求且结构稳定的解答。本文提出Aryabhata 2,一个面向此类考试的推理模型,通过强化学习进行后训练。研究使用PhysicsWallah内部题库构建高质量训练课程,以可验证奖励强化学习对GPT-OSS-20B进行后训练,结合长时间训练与逐步扩大的轨迹采样组来增加探索。在JEE Main、JEE Advanced和NEET等考试基准,以及AIME、HMMT、MMLU-Pro、MMLU-Redux 2.0和GPQA等分布外推理数据集上进行评估。Aryabhata 2在竞争性STEM推理上优于GPT-OSS-20B基座,同时输出词元最多减少64%。