论文
用于根据临床病例报告构建和评估渐进式多模式诊断对话的基于来源的框架
A Source-Grounded Framework for Constructing and Evaluating Progressive Multimodal Diagnostic Dialogues from Clinical Case Reports
摘要
临床诊断需要逐步整合患者病史、体格检查、实验室检查结果、医学图像和诊断信息测试。然而,大多数多模式医学基准评估固定输入或终点答案,而完全交互式诊断代理将证据选择与证据解释混为一谈。我们提出了一个基于源的框架,用于根据病例报告构建渐进式多模式诊断对话,以及用于评估 MLLM 最终诊断、诊断推理和图像查找解释的评估策略。对 24 个内科病例报告的评估表明,我们的框架可以准确地将病例报告转换为参考对话,诊断 F1 为 0.99,推理质量得分为 4.79(满分 5)。对两个前沿 MLLM(o4-mini 和 Claude Haiku 4.5)的评估,推理质量得分分别为 2.75 和 2.50,诊断、推理和图像查找 F1 得分明显较低。结果表明,流畅的反应不一定反映以证据为基础的临床推理,并强调了所提出的评估多模式诊断推理框架的实用性。