论文
可通过构造验证:临床问答中逐字引用的声明级评估
Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering
摘要
大语言模型(LLM)已广泛应用于临床问答(QA)。当前的系统可以将引文附加到他们的答案中,但这些引文通常指向宽泛的文本,使得时间紧迫的临床医生无法有效地验证它们。另一种方法是确保响应可以通过构造进行验证:从证实声明的参考材料中提供细粒度的逐字引用,以便用户可以在不打开其他文档的情况下验证答案。在本文中,我们评估了当前模型端到端执行此任务的能力:从为每个事实主张提供引用,到生成逐字引用,再到确保这些引用充分证实了这些主张。为此,我们在四个临床实践指南上构建了一个标准化工具,并针对 222 个综合临床问题评估了 12 个大语言模型,分别评估了每个阶段。我们发现,除了一些轻量级模型(例如 claude-haiku-4.5)之外,大多数模型都可以通过单独提示将逐字引用附加到超过 90% 的声明中。然而,这些引述往往无法证实其所附声明的每一个细节。例如,claude-opus-5 对其 98.0% 的主张进行了逐字引用,但仅充分证实了 37.1%。我们的工作提供了对大语言模型当前在构建可验证的临床质量保证系统方面的能力差距的见解,以及未来研究的工件。