论文
EHRNote-ChatQA:基于证据的多轮临床问答对纵向出院摘要的基准
EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries
摘要
出院小结是重要的临床文件,包含患者整个住院期间的情况,并由医学专家定期审查,以供患者重新入院、持续护理和诊断决策。在审查它们时,医学专家通常必须迭代地综合多个摘要中的信息,同时验证支持每个答案的证据。尽管大语言模型(LLM)越来越多地被探索用于临床问答,但现有的基准并没有充分反映这种设置:它们经常评估考试式的医学知识或专注于单轮问答,而证据基础评估有限。我们推出了 EHRNote-ChatQA,这是第一个针对患者多次出院摘要进行循证多轮临床问答的基准。 EHRNote-ChatQA 基于去识别化的 MIMIC-IV 出院摘要构建,包含 967 个患者级别的多轮样本,涵盖一到五个注释和 16,072 个经过医学专家验证的 QA 对(8,036 个内容问题,每个问题与一个证据基础问题配对),涉及八个临床类别。该基准是通过专家知情的管道构建的,该管道结合了出院摘要结构化模式、专家策划的多轮 QA 模板和基于 LLM 的生成,然后由 11 名医学专家对每个 QA 样本进行审查和修订。对 22 个开源和闭源 LLM 进行基准测试揭示了一些挑战,包括 LLM 在证据基础方面比内容回答更困难、多轮错误在轮次之间复合,以及单轮临床 QA 性能无法可靠地转移到此设置。这些发现将 EHRNote-ChatQA 确立为评估临床 QA 系统的严格且实用的基准。该数据集将通过 PhysioNet 认证访问公开提供。