论文
DeepSciVerify:通过LLM驱动的证据升级验证科学论断-引用一致性
DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation
摘要
论断与其所引证据之间的不一致是大语言模型生成报告中的常见失效模式,限制了它们在科学及其他高风险场景中的可靠性。我们提出 DeepSciVerify,一个用于科学论断-引用验证的两阶段流水线,它把摘要层面的推理与按需升级到段落级证据相结合。系统首先使用摘要验证论断并搁置不确定的案例,仅在必要时才检索和分析全文段落。这一设计利用了不同 LLM 之间的互补行为:一些模型在不确定性下更保守,另一些则更果断。在 SCitance 基准上,DeepSciVerify 达到 86.7 Micro-F1,比强摘要基线高出 4.5 分,同时 67% 的实例无需全文检索即得到解决。这些结果表明,选择性证据升级能同时提升论断-引用验证的准确性与效率。
