论文
模仿游戏:大语言模型通过以代码为中心的推理数据合成来学习像程序一样的推理
The Imitation Game: When LLMs Learn to Reason Like Programs via Code-Centric Reasoning Data Synthesis
摘要
大型语言模型 (LLM) 擅长编程任务,但在自然语言中的确定性、细粒度推理方面经常失败,严重依赖语义近似而不是强大的符号执行。为了弥补这一差距,我们提出了 MIMIC,这是一个利用可执行代码作为推理数据合成的严格媒介的框架。 MIMIC 通过叙述融合、代码引导的测试合成和动态代码检测,从根本上将算法转变为可验证的推理轨迹。至关重要的是,这些显式的中间执行状态自然形成了代码仪表化奖励(CIR),为强化学习提供密集、高保真的过程监督,而无需外部奖励模型。广泛的评估表明,通过 SFT 和 GRPO 在我们的合成数据集上训练的模型取得了实质性的、一致的收益。我们的方法显着提高了一般推理、复杂数学基准和细粒度确定性任务的准确性,证明可执行代码的程序严谨性可以有效解锁和增强大语言模型的广义推理能力。我们的代码和数据可在 https://github.com/zjy1298/MIMIC 获取。