论文

通过执行驱动的推理增强提升 LLM 的数学问题求解能力

Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation

模型推理推理验证与自校正

摘要

数学问题求解是评估人工智能推理能力的基础基准,也是通往教育、科学与工程中那些依赖可靠符号推理的应用的门户。尽管基于多智能体 LLM 系统的最新进展增强了数学推理能力,它们仍然缺乏对推理过程的可靠、可修订的表示。现有智能体要么运行在无法纠正早期步骤的僵化顺序流水线中,要么依赖可能无法识别并修复错误的启发式自我评估。此外,程序化上下文会分散语言模型的注意力并降低准确率。为填补这些空白,我们提出迭代改进的程序构建(IIPC),一种迭代精炼程序化推理链的推理方法,它把执行反馈与基础 LLM 原生的思维链能力相结合,以维持高层的上下文焦点。在多个基础 LLM 上,IIPC 在大多数推理基准上超越竞争方法。所有代码与实现均已开源发布。

通过执行驱动的推理增强提升 LLM 的数学问题求解能力
图1:IIPC 概览。f_init 从问题陈述中提取关键命题;f_prog 生成初始候选程序;f_val 评估程序的正确性与逻辑一致性;若检测到错误,错误纠正组件 f_err 相应地修订程序;f_cot 生成文本形式的思维链;f_comb 将程序与 token 推理上下文结合以产生最终输出;M_t 表示第 t 个精化步骤处的错误描述记忆;P_t 表示第 t 步的程序存储(program store)。