论文
学习往哪里看:心脏 MRI 视觉语言模型的解剖定位和引导注意力
Learning Where to Look: Anatomical Grounding and Guided Attention for Cardiac MRI Vision-Language Models
摘要
心脏磁共振成像 (CMR) 可以评估心脏解剖结构、心室功能和心肌组织特征。临床医生通过识别心脏结构并关注与每个临床问题相关的区域来解释这些图像,从而激发解剖学引导的视觉语言模型(VLM)。然而,针对解剖定位和临床问题解答的 CMR 特定监督仍然有限。为了解决这一差距,我们通过解剖定位和引导注意力来研究细粒度的 CMR 视觉问答。我们在短轴动态序列、延迟钆增强和长轴动态序列中构建了 128,915 个解剖定位和 42,799 个临床 QA 对。这些数据集支持解剖识别、定位和临床评估,无需针对单个训练图像提供配对报告。为了帮助模型学习向哪里看,我们引入了心脏解剖路由注意力(CARA),它根据问题选择预测的解剖先验,并通过学习的特定于任务的强度来指导解码器注意力。将解剖定位预训练与 CARA 相结合产生了我们的模型 CARA-VL。实验证明了 CARA-VL 在跨 CMR 成像设置的临床评估和区域定位方面的优势,并有望推广到外部临床队列。总之,我们的数据和方法为研究和推进 VLM 中的心脏视觉理解提供了一个实用的框架。我们将在论文发表后公开来自公共数据集的 QA 数据。