论文

ResearchMath-14K:通过代理扩展研究级数学

ResearchMath-14K: Scaling Research-Level Mathematics via Agents

模型训练合成数据

摘要

数学的前沿是由尚不知道解决方案的问题定义的。然而,语言模型是否能够在没有人工干预的情况下有意义地解决此类问题仍不清楚。一个主要障碍是缺乏大规模研究级数学数据集。为此,我们引入了 ResearchMath-14k,这是一组通过多代理管道从学术来源策划的价值 14{,}056$ 的问题。 ResearchMath-14k 跨越 11 个数学领域,在知识、新颖性和程序难度方面均高于现有数学数据集。据我们所知,它是可用于训练的最大的研究级数学问题集。我们还通过有针对性的提示和行为过滤生成了 22万 的教师轨迹。然而值得注意的是,在这个级别上生成正确的轨迹并非易事,两名 LLM 法官仅将采样的 ResearchMath 训练轨迹 $3.7\%$ 和 $4.3\%$ 标记为正确。尽管如此,在三个模型系列中,ResearchMath 的全参数训练将研究生和研究级数学基准的表现比起始检查点提高了 2.1 点。相比之下,对现有数据集(例如 DASD 和 Nemotron-SFT-Math-v4)的训练分别将性能改变 $0.0$ 和 $-0.5$ 点。值得注意的是,在奥林匹克短式($+2.0$)、研究生和研究级短式($+0.8$)、研究生和研究级符号($+2.6$)以及证明评估($+5.7$)等基准测试中,将 DASD 与 ResearchMath 混合比单独使用词元匹配 DASD 可以获得更高的分数。进一步的分析表明,研究水平的数学内容和更大的推理多样性可能有助于解释为什么 ResearchMath 为当代数据集提供补充监督。我们公开提供 ResearchMath-14k,用于未来研究级数学推理的工作。