论文

用于改善医学视觉语言模型的定位镜头

Localization Lens for Improving Medical Vision-Language Models

模型训练监督微调与指令调优

摘要

医学视觉语言模型(Med-VLM)在临床任务中表现出了强大的能力。然而,他们常常难以理解解剖结构和空间定位,而这对于医学推理至关重要。为了解决这个问题,我们建议对 Med-VLM管道进行本地化感知增强,在三个层面引入改进:数据、架构和对齐。首先,我们介绍定位镜头,这是一组经过专家验证的表示,可提供更丰富的解剖和位置背景。然而,随着这些表示增加输入复杂性,我们将像素洗牌集成到模型架构中以过滤和细化表示,增强空间信息处理,同时保持解剖连续性。最后,为了有效地将定位镜头表示与文本特征对齐,我们将解耦对比损失(DCL)与标准损失函数结合在一起。这确保了更好的区分能力功能和稳健性,特别是在数据有限的医疗环境中。通过对医学视觉问答 (Med-VQA) 数据集的广泛评估,我们表明我们的方法提高了不同 Med-VLM架构中本地化驱动的性能。我们对基于定位的问题的分析进一步表明,解剖学和空间推理的改进直接将 Med-VQA 的整体准确性提高了 6.2%。所提出的方法与模型无关,并且可以无缝集成到现有的 Med-VLM管道中。数据集、代码和训练模型将在 https://github.com/CVLABLUMS/localizationlens. 上公开

用于改善医学视觉语言模型的定位镜头的原论文方法或结果图
图 1:现有标准 Med-VLM训练与建议的利用定位镜头的训练的比较。