论文

OptProver:通过形式定理证明的持续训练连接奥林匹克和优化

OptProver: Bridging Olympiad and Optimization through Continual Training in Formal Theorem Proving

模型训练持续学习

摘要

形式定理证明方面的最新进展主要集中在奥林匹克级别的数学上,而本科生领域在很大程度上尚未得到探索。优化是机器学习、运筹学和科学计算的基础,但现有的证明者仍然服务不足。它对特定领域形式主义(凸性、最优性条件和算法分析)的依赖造成了显着的分布变化,使得朴素的领域转移无效。我们推出 OptProver,这是一个训练有素的模型,可以实现从奥林匹克竞赛到本科生优化的稳健迁移。从强大的奥林匹克级证明者开始,我们的管道通过两项关键创新减轻了分销转移。首先,我们通过专家迭代采用大规模的以优化为重点的数据管理。其次,我们引入了一个专门的偏好学习目标,它将困惑加权优化与惩罚有效但不进展的证明步骤的机制相结合。这不仅解决了分布变化,还引导搜索走向有效的轨迹。为了进行严格的评估,我们在 Lean 4 中构建了一个专注于优化的新颖基准。在此基准测试中,OptProver 在同等大小的模型中实现了最先进的 Pass@1 和 Pass@32,同时在一般定理证明任务上保持了竞争性的性能,展示了有效的域转移而不会发生灾难性遗忘。