论文
通过执行驱动的推理增强提升 LLM 的数学问题求解能力
Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation
摘要
数学问题求解是评估人工智能推理能力的基础基准,也是通往教育、科学与工程中那些依赖可靠符号推理的应用的门户。尽管基于多智能体 LLM 系统的最新进展增强了数学推理能力,它们仍然缺乏对推理过程的可靠、可修订的表示。现有智能体要么运行在无法纠正早期步骤的僵化顺序流水线中,要么依赖可能无法识别并修复错误的启发式自我评估。此外,程序化上下文会分散语言模型的注意力并降低准确率。为填补这些空白,我们提出迭代改进的程序构建(IIPC),一种迭代精炼程序化推理链的推理方法,它把执行反馈与基础 LLM 原生的思维链能力相结合,以维持高层的上下文焦点。在多个基础 LLM 上,IIPC 在大多数推理基准上超越竞争方法。所有代码与实现均已开源发布。
