论文
MedSIGHT:迈向医学大视觉语言模型中的基础视觉理解
MedSIGHT: Towards Grounded Visual Comprehension in Medical Large Vision-Language Models
摘要
医学大型视觉语言模型(Med-LVLM)最近在视觉语言理解和医学图像分割方面取得了显着进展。然而,现有模型仍然难以统一这两种功能,这对于实现将视觉发现与语义解释联系起来的临床推理至关重要。我们提出了 MedSIGHT,这是一个统一的框架,为 Med-LVLM 提供结构化、像素级的理解,以实现基础视觉理解。 MedSIGHT 引入了一种新颖的区域感知器模块,该模块可生成以区域为中心的标记,将空间信息直接编码到语言模型的表示空间中。我们进一步在 LLM 词汇表中提出了一个医学区域代码本,允许模型生成离散区域代码作为解剖和病理区域的符号表示。这些代码通过区域感知器进行解码以重建分割掩模,实现端到端的空间定位。最后,MedSIGHT 使用我们提出的渐进式训练策略将 Region Perceiver、Codebook 和 LLM 结合起来,逐渐稳定地对齐这些模块。 MedSIGHT 仅接受 72K 多模态指令对的训练,在医学理解和分割任务上跨多种成像模式实现了最先进的性能。