论文

MTDiag:具有临床意义的 LLM 评估的多轮诊断数据集

MTDiag: A Multi-Turn Diagnostic Dataset Towards Clinically Meaningful LLM Evaluation

模型评测基准与评测资源

摘要

临床诊断本质上是交互式和增量的,但医学中评估 大语言模型 (LLM) 的主导范式仍然是静态 QA 基准或基于模板的对话。这些基准几乎没有说明模型是否可以在动态临床中充当诊断剂,LLM 在多轮设置中显示出显着的准确性和可靠性下降。为了解决这个问题,我们提出了 MTDiag,这是一个由三个异构来源构建的大型多回合诊断对话数据集:DDXPlus、MIMIC-IV 和已发布的病例报告 (AJCR),涵盖常见的 ED 表现以及长尾罕见和非典型情况。所有病例都被标准化为规范模式,锚定在最全面、最广泛采用的医学知识库(UMLS 概念标识符,带有 ICD-10 诊断代码)中。我们发布了该模式、基于 UserLM-8B 的话语生成管道以及经医生验证的数据集,该数据集可将结构化临床证据转换为自然语言话语。重要的是,我们引入并激发了基于临床知识的指标来评估 LLM 作为诊断剂,超越诊断准确性,以完成多轮鉴别诊断的任务。