论文
FormInv:数学推理基准中语义不变性的测量协议
FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks
摘要
MathCheck 的释义质量审核 (ICLR 2025) 在 129 组中检测到 4 个语义不正确的释义 (3.1%);删除它们会使 GPT-4o 从排名 2 下降到排名 4,并将 Claude Haiku 和 DeepSeek V3 提升到其之上;这些排名变化对于任何单一模型评估都是不可见的。跨模型一致自动发现这些错误(MathCheck 的模型>= 3/4;我们的初步评估>= 6/9),费用不到 10 美元;在我们自己的数据集中,相同的协议发现 47% 自动生成的连接词变体释义在语义上是不正确的。这一缺陷加剧了更深层次的测量差距:Claude Haiku 4.5 达到了 86% 的准确率,但 SCR=50%,这意味着它的一半定理在语义等效的重述下得到了不同的答案,而 9 个模型的总体准确度仅为 86-96%,但语义一致性率 (SCR) 却达到了 50-82%,这对于标准基准来说是看不见的 32 点差距。形式上,对于超过 9 个前沿模型的任何目标排名,都存在对实现它的释义系列的权重(无自由基准推论),因为没有模型帕累托主导所有系列 - 因此选择系列的基准设计者隐含地选择了哪个模型获胜。 FormInv 提供审计协议(在 100% 召回率的外部基准上复制)、SCR 和每个定理 Cochran's Q 作为主要不变性度量,在 366-811 个项目的 9 个模型上进行评估(基于 Lean4 验证的定理),以及用于机制感知模型选择的 FormInvSelector。