论文
STAR-PólyaMath:以持续策略监督改善多智能体长程数学推理
STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
摘要
前沿人工智能模型和多智能体系统带来了数学推理的显着改进。然而,对于需要扩展、长视野推理的问题,现有系统仍然面临着基本的可靠性问题:幻觉积累、记忆碎片和推理工具权衡不平衡。在本文中,我们介绍了 STAR-PólyaMath,这是一个多智能体框架,它通过元级监督和结构化推理器-验证器交互来系统地解决这些挑战。 STAR-PólyaMath 被构造为具有嵌套挑战步骤重新计划循环的编排状态机,由无推理的 Python 编排器控制,该编排器将控制与推理分开,并通过回溯和重新规划限制错误传播。我们的关键创新是持久的元战略家,它通过发布高层战略指导或强制性指令来维护跨尝试记忆并行使元级别控制,因此系统可以摆脱无效循环,而不是停滞或过度依赖工具。 STAR-PólyaMath 在所有八个顶级竞赛基准上均取得了最先进的成绩:AIME 2025-2026、MathArena Apex Shortlist、MathArena Apex 2025、Putnam 2025、IMO 2025、HMMT 2026 年 2 月和 USAMO 2026。它在 AIME、Putnam 和 HMMT 上获得了满分,并展示了其在 Apex 2025 上相对基线的优势最大,得分为 93.75%,而最强基线 GPT-5.5 得分为 80.21%。消融研究表明,收益来自框架的编排,而不是来自模型级别的多样性,因为删除关键组件或替换混合主干会持续削弱性能。代码可在 https://github.com/Julius-Woo/STAR-PolyaMath 获取。