论文

验证者支持的数学推理难题生成

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

模型训练合成数据

摘要

大语言模型 (LLM) 表现出解决科学和数学问题的强大能力,但他们难以产生有效的、具有挑战性的和新颖的问题 - 这是推进 LLM 训练和实现自主科学研究的重要组成部分。现有的问题生成方法要么依赖于昂贵的人类专家参与,要么采用幼稚的自我博弈范式,这经常会由于 奖励作弊 而产生无效问题。这项工作介绍了 VHG,一种基于三方自博构建的验证者增强型难题生成框架。通过将独立验证者集成到传统的设置器-求解器二元性中,我们的设计将设置器的奖励限制为由问题有效性(由验证器评估)和难度(由求解器评估)共同确定。我们实例化了两个验证器变体:硬符号验证器和基于 LLM 的软验证器,并对不定积分任务和一般数学推理任务进行评估。实验结果表明,VHG 明显优于所有基线方法。