论文

计算机科学逻辑的理论规模自动形式化

Theory-Scale Auto-Formalization of Logics for Computer Science

模型评测基准与评测资源

摘要

自动形式化对于可扩展的形式验证至关重要,但现有的进展主要集中在孤立的陈述上,而理论规模的自动形式化,它连贯地翻译了数百个相互依赖的定义、引理和定理,由于一致性、忠实性、可扩展性和正确性方面的挑战,仍然处于开放状态。在本文中,我们介绍了 LCS-Bench,这是一种基于计算机科学逻辑的独立理论规模基准。 LCS-Bench 是通过一种新颖的半自动代理管道构建的,该管道利用概念图、正式签名规划、问题跟踪、反例搜索来弥补遗憾,并辅以人类专家的 忠实性 审查。生成的工件涵盖 327 个教科书项目、超过 4,076 个精益声明以及超过 85K 行精益代码。该数据集通过数据引擎支持广泛的评估,该引擎自动派生评估基准的五个轨道,测量自动形式化和定理证明能力的不同方面。我们还引入了一种新颖的评估协议,具有定义等价检查器,可以实现更细粒度和更忠实的评估。通过对14个模型的广泛评估,我们证明:(1)LCS-Bench质量高、一致、忠实; (2) 基准测试具有挑战性,最先进的模型在自动形式化任务上仅取得 20.1% 的成绩; (3)我们的分析揭示了有关理论规模自动形式化的关键发现,并为未来的工作提出了有希望的方向。