论文
RoiMAM:用于高效视觉语言理解的感兴趣区域医疗关注模型
RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding
摘要
视觉语言模型 (VLM) 通过联合解释图像和文本来促进医学视觉问答 (MedVQA)。然而,现有模型通常依赖于大型架构和封闭集答案,这限制了它们的效率和潜在的临床适用性。为了克服这些缺点,我们引入了 RoiMAM,一种高效的 VLM。它将 无需训练 ROI 生成模块与语义选择性抑制集成在一起,以专注于病变相关区域,同时还集成了文本提示增强器模块,可提供特定于模态的上下文,而无需引入训练参数。与广泛使用的 MedVInT-TD 模型相比,我们的设计以不到 20% 的模型大小实现了高效、准确的诊断,同时在 SLAKE 上提高了约 2% 的准确性,在 PMC-VQA 上提高了约 4.6% 的准确性。