论文

面向临床决策支持的大语言模型主动证据获取与诊断推理

Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support

智能体系统Agent任务评测

摘要

大语言模型在静态医学考试中表现良好,但临床诊断往往需要在不确定性下迭代式地收集证据。在既往交互式评估工作的基础上,我们提出一个受OSCE(客观结构化临床考试)启发的标准化病人模拟器,以及一个用于主动诊断问询的受控、可复现基准。在我们的协议下,跨468个病例和15个模型的实验观察到:相对于全上下文评估,多轮证据获取使诊断准确率下降12.75%,支持性证据质量下降24.36%;错误分析将这些下降与过早的诊断闭合和低效提问联系起来。综合来看,这些结果表明静态全上下文基准可能高估交互式证据获取场景中的性能,这促使人们为更安全的临床决策支持补充交互式评估。

面向临床决策支持的大语言模型主动证据获取与诊断推理:论文配图
图 1:用于评估主动临床推理的 ROUNDS-Bench 框架概述。范式比较。将真实的 OSCE 临床工作流程与被动全背景基线和拟议的主动寻证交互协议进行对比。 B 技术管道。说明集成数据集结构化、双任务评估(任务 1 与任务 2)和多维评分的工作流程。 C 数据集分层。所涵盖的六个临床系统的解剖可视化(顶部)以及 4 个异质医学语料库中 468 个病例的分布(底部)。