论文
修复 FOLIO 和 MALLS:经过验证的注释和 LLM 辅助框架以关注人类重新标记
Fixing FOLIO and MALLS: Verified Annotations and an LLM-assisted Framework to Focus Human Relabeling
摘要
从自然语言到一阶逻辑(NL-to-FOL)的准确翻译是神经符号人工智能系统和自然语言推理(NLI)的基础,使得 NL-to-FOL 基准的质量至关重要——但这些数据集从未经过严格审核。我们的第一个贡献是对 \textsf{FOLIO} 的验证分割和 \textsf{MALLS} 测试实例的子集进行系统的人工检查,发现大约 42.5\% 和 42\% 的条目分别包含不正确的 FOL 形式化(即 真值 标签),另外还有不明确的 NL 句子(17.8\% 和 51\%)以及不正确的 NLI 标签的比例。 \textsf{FOLIO} (8.4\%)。我们的第二个贡献是为此类数据集开发和发布校正后的基本事实,表明注释错误会扭曲参考基准任务上的模型评估:使用校正后的基本事实测试三个最先进的 LLM(Gemma~4 31B-it、Qwen3-30B-A3B 和 GPT-4o-mini),准确率提高了 +11 到 +23 个百分点。受这些发现的启发,我们提出了一个基于 LLM 的框架来支持人类手动审查 NL 到 FOL 数据集。通过将审阅者引导至最容易出错的实例,我们凭经验表明,在审阅少于 20% 的实例后,可以实现 90% 的数据集准确性,而无指导审阅则需要超过 76% 的准确率。我们发布了所有经过人工验证的注释和我们框架的代码。