论文

面向数学对象的推理:同策略奖励建模与测试时聚合

Reasoning over mathematical objects: on-policy reward modeling and test time aggregation

模型训练奖励建模与过程监督

摘要

精确推导数学对象的能力是数学、物理、化学等下游STEM应用的核心要求,在这些场景中推理必须最终落实为形式化结构的表达式。然而,由于自动化评估的便利性,当前对LM数学与科学推理的评估严重依赖数值或选择题等简化的答案格式。本文为改进面向数学对象的推理提供三项贡献:(i)构建并发布用于推导数学对象的训练数据和基准,即Principia套件;(ii)提供使用强LLM评审(LLM-judge)与验证器的训练配方,并证明同策略(on-policy)评审训练能提升性能;(iii)展示如何利用同策略训练通过聚合来扩展测试时算力。我们发现Qwen3-235B和o3等强模型在Principia上表现挣扎,而我们的训练配方能在不同LLM骨干上带来显著提升,同时改进现有数值题和MCQA任务的成绩,证明了推理能力的跨格式泛化。

面向数学对象的推理:同策略奖励建模与测试时聚合:论文配图
图 1:在 Principia Collection 上进行 RL 训练需要数学对象输出,从而提高 LM 的推理能力。 (a) 在我们新的具有挑战性的基准 PrincipiaBench 上,需要导出数学对象,在 Principia Collection 上训练的 Qwen3-4B-Base、Qwen2.5-7B-Base 和 OctoThinker-8B-Long-Base 的平均增益分别为 +18.23%、+10.23% 和 +15.16%。 (b) Principia Collection 的训练还提高了数值 (AIME-2025) 和 MCQA (SuperGPQA) 基准的性能,展示了跨格式推理的收益。 (c) 使用强大的基于模型的验证器 (GPT-OSS-120B) 并排除 MCQA 数据可提供最佳性能。