论文
Magenta:让数学推理与Lean验证形成闭环
Magenta: Closing the Loop Between Mathematical Reasoning and Lean Verification
摘要
大多数数学知识都是通过所谓的数学和自然语言的非正式使用来传达的。由于大型语言模型 (LLM) 非常擅长使用自然语言,因此它们在非正式数学推理中取得了强大的性能,但并不完美。限制大语言模型进行非正式推理会错过使用机器通过机器可检查证明提供的离散验证能力的机会。在本文中,我们通过将Lean信号集成到非正式推理过程中,弥合了非正式推理和正式推理之间的差距。我们引入了 Magenta,这是一种无需训练的智能体管道,只要给出自然语言问题,它就会生成答案,将其表达为 Lean 4 语句,并构建机器检查的证明。语句法官验证形式化是否保留了原始问题,而错误归因法官则将失败的尝试路由到数学重新推导或本地Lean修复。 Magenta 在所有评估的奥林匹克基准中实现了 100% 的准确率,包括 AIME 2025、AIME 2026 和 HMMT February 2026。与开放重量 K2-Horizon-7B 推理机配合使用时,它可以解决 IMO 2026 的所有六个问题。我们的分析表明,声明裁决对于防止虚假证书至关重要,并且反馈引导的纠正在困难问题上优于独立重采样。