论文

当检索有所帮助和分散注意力时:评估用于生物医学声明验证的证据生成 LLM

When Retrieval Helps and Distracts: Evaluating Evidence-Generating LLMs for Biomedical Claim Verification

模型评测评测方法与指标

摘要

生物医学事实核查系统必须做的不仅仅是预测某个主张是否得到支持、矛盾或未得到解决:它们还应该提供忠实、完整且对验证有用的证据。我们在 CARE-XAI 上研究了这种证据生成设置,CARE-XAI 是一个涵盖五个生物医学和健康事实核查来源的统一基准。我们在共享评估协议下比较基本指令 LLM、PubMed 检索增强 LLM、微调 LLM、仅标签 LLM 和生物医学编码器分类器。生物医学分类器对于仅做出判决的预测仍然是最强的,而微调的 LLM 是最强的证据生成系统。 PubMed 检索是混合的:它有助于 PubMed 一致的来源,例如 PubMedQA 和 SciFact,但可能会分散更广泛的公共卫生主张的模型的注意力。我们引入了 Bio-GRACE,这是一种相对标准参考证据归一化诊断,用于衡量检索到的证据是否恢复了参考证据的决策优势。 Bio-GRACE 表明检索效用依赖于来源,激发选择性检索,并揭示了为什么检索回忆和词汇证据重叠不足以进行生物医学事实检查。