论文

SCOPE:以语言模型规划策略、符号引擎认证定理

SCOPE: Certified Theorem Proving with a Language Model as the Policy Planner

智能体系统Agent 动作执行与治理

摘要

在 Lean 等证明助手中,生成的证明必须通过机器编译检查,因此评估不需要人工评分。直接生成在多步数值命题上失败:仅当每个内容整数都正确时,证明才有效,因此通过率受每个整数准确度的 k 次方限制。 2,617 个参考证明中的受控扰动证实了这一幂律。 SCOPE(状态条件算子规划和执行)强制执行自然分工:模型对算子词汇进行规划,符号引擎执行数字,编译器呈现证明。在包含 218 个问题的套件上,它使用 135M 骨干模型验证了 191/218 (87.6%); 7B DeepSeek-Prover-V1.5-RL 在 token 的 27.5 倍和实际耗时的 37.5 倍处认证 18/218,而 DeepSeek-Prover-V2-7B 在双向双套件上认证零。多步骤思维每个问题需要 6.12 个离散决策操作,并且不会产生自然语言思维文本。将决策框架中的滞后引擎状态替换为当前状态,可以将通过率从 117/218 提升到 191/218,而提高链末端损失权重会损害表现。在公共 Lean-Workbook 库中,3,536 个可评分的可接受问题中的 2,132 个(60.29%)通过验证,且主套件表现没有退步。所有读数均来自经过独立复查和反向验证的版本冻结审查。限制自由生成并保持决策时信息可见是比放大模型更直接的途径。

SCOPE:以语言模型规划策略、符号引擎认证定理:论文原图
图 1:SCOPE 架构和数据流。数学命题通过离散编码进入潜在决策循环:链规划器及其运算符和参数头处理感知和路由,并在运算符词汇表中每一步做出一个决策,该词汇表提供运算符语义和渲染模板;符号引擎准确地执行每一步,状态框架在状态转移后反馈到决策循环中,因此多步思维是由零生成token(图中零token思维标签)的循环内生承载的。该链及其参数进入证明编译器,该编译器从模板渲染精益文本; Lean编译器对其进行审查,冻结审查程序执行独立的重新检查和反向验证,并输出经过认证的证明。