论文
MedicalBench:评估 大语言模型 以改进医学概念提取
MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction
摘要
从电子健康记录中提取医学概念支撑着许多下游应用,但仍然具有挑战性,因为具有医学意义的概念经常是隐含的,而不是在医学叙述中明确表述的。具有人工注释证据跨度的现有基准强调了将提取的概念扎根于医学文本的重要性。然而,它们主要关注明确陈述的概念,而不是隐含的概念。我们提出了 MedicalBench,这是一个医学概念提取的基准,具有评估隐性医学推理的证据基础。 MedicalBench 将医学概念提取制定为医学笔记-概念对的验证任务,并结合句子级证据识别。该数据集基于 MIMIC-IV 出院摘要和经人工验证的 ICD-10 代码构建,通过多阶段 大语言模型 (LLM) 分类流程进行整理,然后进行医学注释和专家评审。它故意包括隐含的肯定、语义上易混淆的否定,以及 LLM 判断与医学专家评估不一致的情况。我们定义了两个互补的评估任务:(1)医学概念提取和(2)句子级证据检索,从而能够评估正确性和可解释性。对最先进的 LLM 进行基准测试表明,性能仍然有限,凸显了提取隐式表达概念的难度。我们进一步表明,性能在很大程度上与注释长度无关,这表明 MedicalBench 隔离了推理难度,而不是表面的混杂因素。 MedicalBench 为隐性的、基于证据的医学概念提取提供了第一个系统基准,为开发医学语言模型奠定了基础,该模型既可以识别医学相关概念,又可以以透明和医学上忠实的方式证明其预测的合理性。