论文

可能还是确定?评估临床文本中诊断不确定性保留的基准

Possible or Definite? A Benchmark for Evaluating Diagnostic Uncertainty Preservation in Clinical Text

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于临床文本任务,例如总结和修订。虽然大多数研究评估 LLM 生成文本的流畅性和连贯性,但 LLM 是否正确保留诊断不确定性仍有待探索。在临床实践中,诸如“可能的肺炎”之类的短语传达了现有证据的强度,并直接指导有关后续检测和治疗的决定。改变这些不确定性表达可以完全改变临床意义。在本文中,我们分两个步骤系统地评估了这个问题。首先,我们构建了包含 1,200 个临床文档的基准,其中包含五个级别的 9,184 个不确定性注释。其次,我们在此基准测试中评估了三个 LLM。我们的结果表明(1)LLM 保留原始不确定性线索的能力很差,通常不到一半的时间; (2) LLM 与相邻级别之间的细微差别作斗争。这项工作揭示了标准评估指标未捕获的故障模式,并为 LLM 在临床工作流程中的安全部署提供了启示。