论文

ReverseMath:生成可扩展且可验证的数学问题的答案反演

ReverseMath: Answer Inversion for Scalable and Verifiable Mathematical Problem Generation

模型训练合成数据

摘要

数学推理基准对于评估 大语言模型 (LLM) 至关重要,但许多基准都是静态的,并且通过公共评估和训练渠道反复暴露,因此很难将真正的推理与记忆分开。与此同时,手动构建具有可靠答案的新数学问题仍然成本高昂。我们引入了 ReverseMath,这是一种通过答案反转生成新数学问题的可扩展方法。给定一个问题及其答案,ReverseMath 会屏蔽原始问题中的数值,将原始答案视为已知条件,并重写问题,使屏蔽值成为新答案。生成的问题颠倒了原来的输入输出关系,通过构造得出其答案。我们研究逆向数学是为了评估和训练。为了进行评估,配对的原始/反转问题揭示了重大的行为转变:模型有时会在反转问题上失败,甚至错误地输出原始答案,这表明类似记忆的行为。对于训练,ReverseMath 提供自动标记的反向问题作为强化学习 (RL) 的数据增强。实验表明,包含 ReverseMath 生成的数据可以提高跨多个基准的数学推理性能,证明其作为分析工具和可验证训练数据的可扩展来源的价值。