论文
测试翻译:基于证明者的 NL$\rightarrow$FOL 评估指标
Quizzing the Translation: A Prover-Grounded Evaluation Metric for NL$\rightarrow$FOL
摘要
对自然语言问题进行符号推理的标准管道将其转换为一阶逻辑并调用定理证明器。翻译步骤是瓶颈:将“every”替换为“some”,随后的每个推论都会被破坏。然而,今天的指标通常对损坏程度较高的翻译得分高于损坏程度较低的翻译,因为 BLEU、BERTScore 和 Smatch++ 奖励表面重叠,而最严重的错误恰好保留了下来。我们引入了 SIV,它从目标公式导出两种探针,并使用定理证明器来验证每种探针的候选翻译。积极探测是候选人必须包含的陈述,它检测删除内容的翻译;对比探查是候选者不得包含的陈述,它检测比原始断言更多的翻译。在受干扰的 FOLIO 翻译的受控池中,错误的严重性占 SIV 分数方差的 80%,而任何先前指标的这一比例最多为 17%。在不相交池上的六个错误类别中,SIV 在超过 99% 的配对中将参考评分高于受干扰的候选者。由于每个探针都标有其测试的内容,因此故障模式还提供标记的错误跟踪,将扰动类别恢复为宏 F1 0.638,几乎是仅分数基线的两倍。在 434 份经过专家审核的真实 LLM 翻译中,SIV 获得了最高的 AUC,以独特的方式检测专家标记的重大错误并对其进行评分,并对词汇外的翻译进行弃权,而不是错误评分。