论文
ClinFusion:以视觉为中心的多模态 LLM 系统,用于整体医学理解
ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
摘要
多模态 大语言模型 (MLLM) 具有彻底改变临床实践的巨大潜力,但在医学领域部署它们从根本上来说是一个以视觉为中心的挑战:模型必须吸收异构 2D 和 3D 医学图像中的知识,评估协议必须与放射科医生的临床实践保持一致,并提供准确、细粒度和以事实为导向的评估。在本文中,我们介绍了 ClinFusion,这是一种以视觉为中心的 MLLM,旨在实现整体医学理解,系统地解决这些局限性。我们提出了一种组合级联视觉编码器架构,具有级联空间感知局部融合算子,可在融合编码器内统一不同的 2D 和本机 3D 医学图像理解。我们进一步引入了基于视觉的评估框架,包括用于指令遵循评估的 MedIF-Bench 和用于临床对齐和事实驱动的报告生成评估的基于兴趣区域的方法。我们表明,ClinFusion 在一套全面的 2D 和 3D 多模态医疗基准测试中树立了新的最先进水平——涵盖视觉问答、报告生成和指令跟踪——以及文本医疗任务,在 24 个基准测试中的 20 个上优于领先的开源医疗 MLLM(\textit{e.g.}、Hulu-Med、Lingshu),并展示了比强大的专有模型更好的多模态功能,例如GPT-5.2 和 Gemini-3-Flash 在 16 个基准测试中的 13 个上运行,并且可以通过使用代理工具进一步增强检索增强和工具辅助的临床工作流程。由委员会认证的放射科医生进行的盲法评估证实,ClinFusion 生成了排名最高的报告,并验证了我们的基于投资回报率的指标在所有检查的自动评估指标中与专家判断的相关性最强。