信号覆盖矩阵:语句自动形式化中的分层类型和语义错误
The Signal-Coverage Matrix: Stratifying Type and Semantic Errors in Statement Autoformalization
摘要
LLM 自动形式化的标题类型正确性 (TC\%) 在两年内从 $\sim$53\% 攀升至 $\sim$76\%,但这个标量隐藏了每种方法解决的错误。我们提出了一个信号覆盖矩阵,将精益阐述器(通过/失败)与语义等价判断(等价/不等价)相结合,将每个输出分类到四个单元格之一:真正成功(TS)、仅类型(TO)、仅语义(SO)或两者都失败(BF)。在使用 DeepSeek V4-Pro 进行 Vanilla、Lean-Retry、Sample-Filter 和分层自动形式化 (SAF) 的 ProofNet\# 和 MiniF2F 测试上:(1) 三种 elab-feedback 方法的 +34 到 +36 TS 增益为 $\sim$64\% 类型层恢复,SO 在网络上持平(87.5\% 的原始语义错误已被挽救,8 个新创建)。 (2) 每种方法的 TO-to-TS 比率为 23/61 (Wilson 95\% CI [26.6\%, 50.3\%]),并且此层级恢复率预测保留方法上的 $Δ$TS 在 2/186 以内,并在六个(模型、数据集)单元格中的 Vanilla elab 失败率中呈现 $Δ$TC 线性 ($R^2=0.96$)。 (3) 两位法官在 elab 反馈输出上有 26 到 37 个百分点的分歧(而 Vanilla 上有 7 个百分点),其中 30 到 56% 的符号判断漏报可追溯到阐述者强制重写。持久残差减少到两个标准形式化错误。 TC\% 增益应根据移动的单元格来确定,而不是仅根据标量来确定。