论文
SCOPE:以语言模型规划策略、符号引擎认证定理
SCOPE: Certified Theorem Proving with a Language Model as the Policy Planner
摘要
在 Lean 等证明助手中,生成的证明必须通过机器编译检查,因此评估不需要人工评分。直接生成在多步数值命题上失败:仅当每个内容整数都正确时,证明才有效,因此通过率受每个整数准确度的 k 次方限制。 2,617 个参考证明中的受控扰动证实了这一幂律。 SCOPE(状态条件算子规划和执行)强制执行自然分工:模型对算子词汇进行规划,符号引擎执行数字,编译器呈现证明。在包含 218 个问题的套件上,它使用 135M 骨干模型验证了 191/218 (87.6%); 7B DeepSeek-Prover-V1.5-RL 在 token 的 27.5 倍和实际耗时的 37.5 倍处认证 18/218,而 DeepSeek-Prover-V2-7B 在双向双套件上认证零。多步骤思维每个问题需要 6.12 个离散决策操作,并且不会产生自然语言思维文本。将决策框架中的滞后引擎状态替换为当前状态,可以将通过率从 117/218 提升到 191/218,而提高链末端损失权重会损害表现。在公共 Lean-Workbook 库中,3,536 个可评分的可接受问题中的 2,132 个(60.29%)通过验证,且主套件表现没有退步。所有读数均来自经过独立复查和反向验证的版本冻结审查。限制自由生成并保持决策时信息可见是比放大模型更直接的途径。
