论文

推理核心:为完成监督推理训练设计广泛的程序数据

Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training

模型训练合成数据

摘要

程序生成器可以大规模地产生有用的可验证推理问题,但作为完成监督的 微调 的数据,受到的关注较少。我们推出 Reasoning Core,它是 50 个生成器的集合,涵盖数学、逻辑、规划、状态跟踪、形式语言、结构化数据、游戏、因果关系和代码,以及语义评分器、难度控制和任务评估器。在匹配的完成监督协议下,我们将 Reasoning Core 与 Procedural Warmup、 Reasoning Gym 和 SynLogic 在四种基本模型设置和多个训练持续时间上进行比较。在主要 3B 比较中,推理核心在 DROP、LogiQA 和 ARC-Challenge 上取得了最高的平均分数,超过了没有程序数据的基线和所有三个替代程序集合。任务级分析表明,仅语义有效性并不能确保训练实用性,强调紧凑的目标和校准难度是重要的设计因素。我们结合模型辅助审查、人工裁决和回归测试进行了审计。在整个推理核心开发和其他集合中应用时,它们揭示了生成、渲染、目标和评分之间微妙的不匹配,这提醒人们,程序生成本身并不能保证正确性。该库、生成的数据集和审计材料都是公开可用的。