论文
使用 大语言模型 进行医学推理:调查和 MR-Bench
Medical Reasoning with Large Language Models: A Survey and MR-Bench
摘要
大语言模型 (LLM) 在医学检查类任务中取得了出色的表现,激发了人们对其在现实临床环境中部署的兴趣日益增长。然而,临床决策本质上是安全关键的、依赖于环境的,并且是根据不断变化的证据进行的。在这种情况下,可靠的 LLM 性能不仅仅取决于事实回忆,还取决于强大的医学推理。在这项工作中,我们用 LLM 全面回顾了医学推理。基于临床推理的认知理论,我们将医学推理概念化为溯因、演绎和归纳的迭代过程,并将现有方法组织成涵盖基于训练和 无需训练 方法的七大技术路线。我们进一步在一致的实验环境下对代表性医学推理模型进行统一的跨基准评估,从而能够对现有方法的实证影响进行更加系统和可比的评估。为了更好地评估临床推理,我们引入了 MR-Bench,这是一个源自真实世界医院数据的基准。 MR-Bench 的评估揭示了考试水平表现与真实临床决策任务准确性之间的显着差距。总体而言,这项调查提供了现有医学推理方法、基准和评估实践的统一视图,并强调了当前模型性能与现实世界临床推理要求之间的主要差距。