论文

DeepSciVerify:通过LLM驱动的证据升级验证科学论断-引用一致性

DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation

上下文与知识检索增强

摘要

论断与其所引证据之间的不一致是大语言模型生成报告中的常见失效模式,限制了它们在科学及其他高风险场景中的可靠性。我们提出 DeepSciVerify,一个用于科学论断-引用验证的两阶段流水线,它把摘要层面的推理与按需升级到段落级证据相结合。系统首先使用摘要验证论断并搁置不确定的案例,仅在必要时才检索和分析全文段落。这一设计利用了不同 LLM 之间的互补行为:一些模型在不确定性下更保守,另一些则更果断。在 SCitance 基准上,DeepSciVerify 达到 86.7 Micro-F1,比强摘要基线高出 4.5 分,同时 67% 的实例无需全文检索即得到解决。这些结果表明,选择性证据升级能同时提升论断-引用验证的准确性与效率。

DeepSciVerify:通过LLM驱动的证据升级验证科学论断-引用一致性:论文配图
图 3:用于 SCitance 训练+开发集上仅抽象验证的行归一化混淆矩阵。每个模型都给出了主张和证据摘要,并预测支持、矛盾或 NEI。行表示黄金标签,列表示预测标签。这些矩阵揭示了模型之间不同的校准模式,包括保守行为、过度承诺和特定类别的误差不对称。我们在组合的 train+dev split (n=565n=565) 上计算这些矩阵,以获得更稳定的校准估计;参见第 6.2 节。