论文

FORALL-LEAN-AGENT 用于形式数学和软件验证中的可审计推理

FORALL-LEAN-AGENT for Auditable Reasoning in Formal Mathematics and Software Verification

智能体系统Agent Harness

摘要

编码Agent越来越自动化Lean证明开发,但仅成功的编译并不能证明候选者在可接受的假设下证明了预期的陈述。我们提出了 FORALL-LEAN-AGENT,这是一个与前端无关的框架,用于形式数学和软件验证中的可审计推理。该框架将独立的工作空间、Lean工具和新的审查与语句比较、公理审计和独立证明检查(如果支持)结合起来。验证证据和审阅者决策都绑定到相同的候选工件,从而使验收可追溯。我们在 VeriSoftBench、PutnamBench 以及Lean评估软件验证轨道中的两个问题上评估该框架。在 100 项任务的 VeriSoftBench 子集中,与 FORALLLEAN-AGENT 的集成可轻松地将 GPT-5.6 Sol 的基准规则成功率从 93 提高到 100,同时降低 $69 to $62 的成本。 PutnamBench 评估接受全部 672 个问题,平均每题 4.72 美元。这些结果表明,Agent工具设计可以提高正确性和效率,同时提供超出总体解决计数的证据。