论文

评估SageMath增强的LLM智能体用于计算与实验数学

Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics

智能体系统Agent任务评测

摘要

AI for Mathematics的最新进展主要聚焦自动形式化与定理证明,计算机代数系统(CAS)在智能体LLM工作流中的角色仍待探索。我们提出ReAct式智能体设定:结合LLM推理与来自SageMath的可验证反馈,加上用于最新文档的Context7。我们在模拟计算数学研究环路的设定下,跨前沿模型评估该智能体设定求解RealMath基准的研究级数学问题。我们还对RealMath基准提出精炼——引入多步后处理流程与多阶段验证管线,两者都改善所提取问题集的质量与可靠性。实验揭示SageMath访问带来的大幅表现增益:所有受评模型平均+9.7分——增益区间1.5至27.8分,并缩小开源与闭源模型差距。Qwen 3.7-Max从SageMath获益最多,而GPT-5.5在启用工具的配置中取得最高解题率75.2%与最低token用量。结果表明CAS增强智能体是辅助数学家计算探索的有前景方向,我们相信本工作是迈向自动猜想发现的一步。

评估SageMath增强的LLM智能体用于计算与实验数学:论文配图
图 1:拟议的可执行数学推理评估框架概述。 ReAct 风格的 LLM 代理通过迭代工具的使用与 SageMath 和 Context7 交互,从符号计算接收可验证的反馈,并通过符号等价检查和辅助 LLM-as-a-Judge 阶段生成经过验证的最终答案。