论文
CardioLens:通过多序列心脏 MRI 评估揭示 MLLM 的临床现实差距
CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations
摘要
多模态 大语言模型 (MLLM) 在公共医疗基准上表现出了强劲的性能,但现有的评估对于临床使用来说往往仍然是较弱的代理,依赖于孤立的输入和简化的识别式任务。我们推出 CardioLens,这是一种用于多序列心血管磁共振 (CMR) 的防泄漏评估测试台,它是根据私人医院档案通过严格的报告到 QA 构建和验证流程构建的。 CardioLens 包含 4D Cine、LGE、灌注和 T2 加权成像的 473,896 个切片和 13,494 个经过验证的 QA 对,并评估 CMR 解释的三个阶段:图像理解、报告生成和疾病诊断。在 24 个最先进的 MLLM 中,CardioLens 揭示了巨大的临床现实差距:模型总体表现不佳,随着真实的 CMR 工作流程性能下降。混淆分析进一步显示了类别崩溃失败模式,其中模型默认为频繁的异常类别,而不是区分临床上不同的发现。为了排除 MLLM 兼容的输入结构作为主要原因,我们比较了不同切片预算下的随机、临床动机和数据驱动的切片选择协议;性能变化很小,通常约为 1%。明确的推理提示也无法挽救性能,通常会使模型更加保守,而不是改善视觉证据的使用。这些结果表明,当前的 MLLM 距离可靠的 CMR 解释还很远,其中临床决策需要整合跨序列、视图和时间阶段的分布式证据。 CardioLens 提供了一个基于临床的测试平台,用于开发下一代 MLLM 以实现实际临床部署。