论文
评估SageMath增强的LLM智能体用于计算与实验数学
Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics
摘要
AI for Mathematics的最新进展主要聚焦自动形式化与定理证明,计算机代数系统(CAS)在智能体LLM工作流中的角色仍待探索。我们提出ReAct式智能体设定:结合LLM推理与来自SageMath的可验证反馈,加上用于最新文档的Context7。我们在模拟计算数学研究环路的设定下,跨前沿模型评估该智能体设定求解RealMath基准的研究级数学问题。我们还对RealMath基准提出精炼——引入多步后处理流程与多阶段验证管线,两者都改善所提取问题集的质量与可靠性。实验揭示SageMath访问带来的大幅表现增益:所有受评模型平均+9.7分——增益区间1.5至27.8分,并缩小开源与闭源模型差距。Qwen 3.7-Max从SageMath获益最多,而GPT-5.5在启用工具的配置中取得最高解题率75.2%与最低token用量。结果表明CAS增强智能体是辅助数学家计算探索的有前景方向,我们相信本工作是迈向自动猜想发现的一步。
