论文
SHADOWBENCH:自动形式化中语义对齐的可靠自动评估
SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization
摘要
自动形式化将非正式的数学定理转化为 Lean 等证明助手的代码。一个主要挑战是当前的评估指标可以接受类型正确但不一致的语句,或者拒绝以不同公式编写的正确语句。受 Pass@$k$ 的启发,我们提出 SA-Pass(*语义对齐 Pass*),它使用称为 *shadows* 的辅助语句来测试正式语句,这些辅助语句描述了预期的语句。生成的语句仅在编译时才获得完整积分,暗示每个影子(前向检查),并由它们的合取暗示(后向检查)。我们在 ShadowBench 中实例化 SA-Pass,ShadowBench 是一个 Lean 4 完全自动形式化基准,涵盖 8 个数学领域的 178 个研究生到研究级问题。使用 Numina-Lean-Agent 的 Claude Code (Opus 4.8) 编译率达到 $61.8\%$ ,SA-Pass 达到 $11.2\%$ 。在六种代理配置生成的输出中,SA-Pass 与专家判断达成了 98.8\%$ 二进制协议。 ShadowBench 的早期版本用作 ICML 2026 AI4Math 挑战赛第 4 场的基准。