论文

RMA:面向研究级数学问题的智能体系统

RMA: an Agentic System for Research-Level Mathematical Problems

智能体系统上下文与知识记忆Agent 协作Agent记忆

摘要

我们提出研究数学智能体(Research Math Agents, RMA),一个面向研究级数学问题自动推理的智能体框架。与以往聚焦竞赛数学或形式化定理证明的研究不同,RMA面向需要长程推理、文献支撑与迭代证明精炼的研究级数学问题。RMA将研究级证明求解分解为问题分析、文献检索与理解、公平比较、知识库构建以及证明验证等专门模块,全部由初始化者、提出者与验证者三类代理通过共享结构化记忆来协调。在这一统一框架内,这些代理以多角色、多轮次的工作流运转,通过迭代反馈协同生成、精炼并验证候选证明。我们在First Proof基准上评估RMA,该基准由不同领域专家数学家贡献的十道研究级问题组成。通过全面的专家评估,RMA在First Proof基准上超越了GPT-5.2R与Aletheia等强基线,解决了十道研究问题中的八道,并产出逻辑更严密、可读性更高的证明。全面的消融研究进一步表明,性能提升源于结构化推理模块、迭代精炼与基于验证者的反馈之间的相互作用,而非任何单一组件。我们的解答与实现将在论文接收后公开。

RMA:面向研究级数学问题的智能体系统:论文配图
图 2:用于研究级数学自动推理的 RMA 概述。 (左)该系统基于六个专业模块构建,支持问题形式化、文献基础、知识重用和严格的证明构建。 (中)由初始化者、提议者和验证者代理组成的多代理架构通过共享结构化内存进行交互,并具有对问题状态、文献上下文、知识条目、证明和反馈的特定于角色的读/写权限。 (右)推理在多轮中迭代进行:初始化器生成初始草案,提议者代理通过不同的策略完善候选证明,验证者代理提供结构化批评,从而通过交替工作流程实现逐步改进。