论文
通过知识引导的空间提示增强医学视觉基础
Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts
摘要
医学视觉基础 (MVG) 旨在从自由文本放射学报告中识别诊断相关短语,并在医学图像中定位其相应区域,提供可解释的视觉证据以支持临床决策。尽管最近的视觉语言模型(VLM)表现出有希望的多模态推理能力,但它们的基础空间精度仍然不足,这很大程度上是由于仅依赖潜在嵌入时缺乏明确的定位先验。在这项工作中,我们从注意力角度分析了这一局限性,并提出了 KnowMVG,这是一种用于 VLM 中 MVG 的知识先验和全局局部注意力增强框架,可在解码过程中明确增强空间意识。具体来说,我们提出了一种知识增强的提示策略,将短语相关的医学知识编码成紧凑的嵌入,并结合全局局部注意力,共同利用粗略的全局信息和精细的局部线索来指导精确的区域定位。本土化。这种设计桥接了高级语义理解和细粒度视觉感知,而无需引入额外的文本推理开销。对四个 MVG 基准的大量实验表明,我们的 KnowMVG 始终优于现有方法,与之前最先进的方法相比,AP50 提高了 3.0%,mIoU 提高了 2.6%。定性和消融研究进一步验证了每个组件的有效性。