论文
当证据发生冲突时:检索增强生物医学问答中的不确定性和顺序效应
When Evidence Conflicts: Uncertainty and Order Effects in Retrieval-Augmented Biomedical Question Answering
摘要
生物医学检索增强型 大语言模型 (LLM) 经常面临不完整、误导性或内部矛盾的证据,但评估通常强调有用背景下答案的准确性,而不是冲突下的可靠性。使用 HealthContradict,我们在五个受控证据条件下评估六个开放权重 LLM:无检索上下文、仅正确上下文、仅错误上下文以及以相反顺序包含正确和矛盾文档的两个混合条件。在这种相互冲突的证据顺序对比中,相同的两个文档都存在,只是它们的顺序颠倒了,每个模型的准确性都会下降,并且预测会发生 11.4%--25.2% 的翻转。为了支持在这些困难情况下的弃权,我们还评估了将模型置信度与证据冲突检测器相结合的冲突感知弃权分数。在两种最困难的条件下,该分数比仅置信度提高了选择准确性,在 75%、50% 和 25% 的覆盖范围内,仅错误 (‘IC’) 条件下平均提高了 7.2--33.4 分,在错误优先冲突 (‘ICC’) 条件下平均提高了 3.6--14.4 分。这些结果表明,相互冲突的生物医学证据既是不确定性又是鲁棒性问题,并激发了明确解释证据分歧的评估和弃权方法。