论文
道歉不是难的部分:半自主形式化的专家评审案例研究
Sorries Are Not the Hard Part: An Expert-Review Case Study of a Semi-Autonomous Formalization
摘要
大型语言模型通常可以弥补交互式定理证明者中的证明差距,但经过验证的定理与可重用的库贡献不同。我们通过详细的案例研究来研究这种区别:格洛腾迪克消失定理的半自主形式化。最初的版本可以顺利编译,但专家评审发现定义、定理通用性、文件组织和 API 方面存在严重问题。然后,我们运行了审查驱动的重构和压缩流程,并获得了第二次专家审查。前后比较显示出明显的分歧:代理很好地适应了本地的、可机械检查的反馈,但在选择定义和设计 API 方面仍然很弱。我们认为,自动形式化不仅应该通过封闭的抱歉来评估,还应该通过由此产生的形式化是否能通过专家审查来评估。
