论文
EndoVLM:通过解剖学引导的稀疏性和渐进对齐的内窥镜视觉语言 预训练 模型
EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment
摘要
基础模型(FM)的发展对于推进内窥镜图像分析至关重要。然而,现有的内窥镜FM主要依赖于单模态图像或视频的自监督学习,忽视了临床报告中包含的丰富语义知识。此外,有效利用这些记录受到基本模态差距的阻碍:结构化的解剖描述不能自然地映射到高冗余、未经策划的视觉流中的特定帧。在本文中,我们提出了 EndoVLM,这是一种新型视觉语言 FM,经过超过 348K 次内窥镜检查的预训练,每次都将临床报告与其相应的图像集配对。解剖学引导的稀疏池机制利用文本描述作为查询来驱动稀疏注意力,有效地将语义上显着的帧聚合成跨冗余图像集的特定于解剖学的视觉表示。接下来,渐进式语义感知对齐策略通过结构化软目标对临床分类(解剖学和病理状态)进行建模,弥合了从全局患者级别匹配到细粒度局部对齐的差距。最后,语义集中的蒙版自动编码器专门应用于这些语义丰富的帧,将底层视觉精度与强大的高层语义表示相结合。跨各种下游任务的大量实验表明,EndoVLM 优于现有的基础模型,并且与特定任务的方法相比仍然具有竞争力。值得注意的是,EndoVLM 还表现出强大的零样本泛化能力,凸显了其更广泛临床应用的潜力。