论文

声明验证数据集实际测试什么?推理轨迹分析

What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis

模型评测评测方法与指标

摘要

尽管声明验证方面取得了快速进展,但我们对这些基准实际执行的推理缺乏系统的了解。我们使用 GPT-4o-mini 为 9 个数据集的 24K 声明验证示例生成结构化推理轨迹,发现直接证据提取占主导地位,而多句子合成和数字推理的代表性严重不足。数据集级别的细分揭示了明显的偏见:一些数据集几乎专门测试词汇匹配,而其他数据集则在大约一半的情况下需要信息合成。使用紧凑的 1B 参数推理验证器,我们进一步表征了五种错误类型,并表明错误概况因领域而异——一般领域验证以词汇重叠偏差为主,科学验证以过于谨慎为主,数学验证则以算术推理失败为主。我们的研究结果表明,高基准分数主要反映了检索加蕴涵能力。我们概述了构建更具挑战性的评估套件的建议,以更好地测试验证系统所需的推理能力。