论文

超越判决:科学事实核查中人类和 LLM 推理的基于图形的分析

Beyond Verdicts: A Graph-Based Analysis of Human and LLM Reasoning in Scientific Fact-Checking

模型评测评测方法与指标

摘要

当引用合法论文的错误信息歪曲了这些研究的实际报告内容时,其危害尤其严重。虽然基于 大语言模型 (LLM) 的现有自动事实检查系统可以评估模型是否给出了错误的裁决,并可以为该决策生成解释,但它们通常不会表明模型是否遵循与人类专家相同的推理路径,或者通过不同但仍然有效的路径得出裁决。在这项工作中,我们引入了一个基于图的框架(类型化推理图),用于在科学事实检查中比较人类和 LLM 推理路径。基于之前关于生物医学错误信息中错误推理的工作 MISSSCIPLUS (Glockner et al., 2025),我们将每个解释建模为推理图,将错误主张与相关研究背景、研究结果、支持谬误的前提和谬误标签联系起来。这种表示使得人类推理和 LLM 推理能够在特定于谬误的子图级别上进行一对一的对齐。对于非人类对齐的 LLM 路径,我们验证所引用研究的基础、与主张的相关性以及结论的充分性。我们使用 MISSCIPLUS 的 84 个虚假声明,在提示和证据设置中评估了 GPT-5、Claude Opus 4.7 和 Qwen3-32B。结果显示出不同的性能维度:Qwen3-32B 的判决失败率最低,GPT-5 的人类比对最高,Claude Opus 4.7 的判决预测较弱,但在成功案例中推理通常有效