论文

谬误基准衡量方案识别,而不是谬误检测

Fallacy Benchmarks Measure Scheme Recognition, Not Fallacy Detection

模型评测评测方法与指标

摘要

谬误检测基准将谬误类与单个“有效”或“无”类配对,该类接受数据收集中未标记为谬误的所有内容。检测器有两项工作,确定一个论证是否错误并指出它犯了哪种谬误,而误报率旨在衡量第一个。我们表明,这些基准测试实际上得分的是方案识别,即第二份工作背后的能力。他们自己的测试集已经表明:当分类器错过一个谬误时,错误会落在“无”而不是另一个谬误类型上,因此在分类成立时检测会失败。原因是有效类缺少什么。将这两项工作分开的负面因素是使用相同论证方案作为谬误的正确论证,而且它们很稀缺:在我们检查的四个基准中几乎不存在,即使在刻意的搜索下也很少见。因此,检测器永远不会在识别方案和判断其使用分开的情况下进行测试,并且可以单独传递识别。我们构建了缺失的参数,以及来自同一管道的控制条件,该管道仅在方案上有所不同,因此无论一代有何贡献,它都会对两者都有贡献。分类器将方案匹配的负例标记为源谬误,并将错误方案负例标记为他们实际使用的方案(85.9%)和源类型(0.4%)。分类器已经了解参数使用哪种方案,而不是它是否正确使用它。过度标记如下:在 CoCoLoFa 自己的有效类上得分为 16.6% 的模型标记了 58.9% 的构造参数。同样的解离现象出现在三个从未见过这些基准的零样本 LLM 检测器中。我们将这些项目作为计划箔发布。在对有效类别的方案匹配覆盖范围进行审核之前,不应将报告的误报率视为检测措施。