论文

带验证器落地基准协同进化的自修改Lean证明智能体

Self-Modifying Lean Proof Agents with Verifier-Grounded Benchmark Coevolution

智能体系统Agent Harness智能体自我改进

摘要

设计有效的Lean证明智能体是形式化数学推理的核心挑战。除了构建更强的证明器,近期工作强调Lean周边的工作流:智能体如何分解证明义务、使用工具与编译器反馈、诊断失败、修复证明并维护结构化证明上下文。受代码级自进化智能体启发,我们研究这类工作流能否被进化而非手工设计。我们提出一个自进化的Lean证明智能体:一个小的固定可信运行时包裹完全可变的工作区——证明工作流、提示与工具。与多数针对固定外部基准优化的自进化系统不同,我们的系统让智能体与其基准协同进化:代与代之间,最高分智能体(冠军)经掌握节流的课程更新修订活动任务分布——只有当前层级被掌握后才引入更难的证明义务;单锚重校准让冠军在更新后的基准上重跑,以在难度上升时保持分数可比。所有进化都留在以Lean为根基的验证回路内:无论智能体如何改写自己,只有其行为在可信快照下产出经Lean验证的证明才算成功,且每次尝试必须发出机器可读、以Lean为根基的证明上下文——其表示可演化,但其落地性被强制保证。我们运行协同进化轨迹与固定基准基线各15个活动代,并在留出的miniF2F测试划分上比较:最佳协同进化智能体达45.1%留出解题率,种子为12.7%、最佳固定基准智能体为32.0%,表明以验证器为根基的自进化能在协同进化基准下改进Lean证明工作流。

带验证器落地基准协同进化的自修改Lean证明智能体:论文配图
图 1:冠军驱动的智能体 - 基准协同进化。种子代理产生第一代(G1)子代,这些子代在评估时流入共享档案,因此强大的早期子代已经可以成为同一代中后来的兄弟姐妹的父母;最强的孩子成为冠军,为下一代(G2)播种,并推动基准更新。收集所有代理商的评估记录。基准是从按难度级别分层的候选问题池中抽取的(L1L_{1}:单策略引理;L2L_{2}:miniF2F 有效分割,与仅用于泛化的保留测试集不相交;L3L_{3}:PutnamBench)。当冠军清除更新阈值时,已掌握的任务将被淘汰,并被同一级别的新任务横向取代,或者一旦掌握了该级别,则被下一个级别的更困难的任务取代。然后使用更新后的基准来评估下一代。为了在基准变得更难时保持分数可比,冠军将作为单锚重新校准在更新的基准上重新运行:使其标准化分数相等,例如0.39×1=0.32×c0.39\times 1=0.32\times c,产生新的难度系数c=1.24c=1.24(说明性值)。