论文
CapCLIP:用于无线胶囊内窥镜分析的视觉语言表示对齐方法
CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis
摘要
无线胶囊内窥镜 (WCE) 能够对小肠进行非侵入性视觉评估,但其临床实用性受到每次检查生成的大量帧以及在高度可变的成像条件下难以识别细微异常的限制。现有的基于学习的 WCE 方法主要仅限于视觉,通常仅限于狭窄的病理学集,并且在数据集和中心之间的迁移有限。为了解决这些限制,本研究引入了 CapCLIP,这是一种用于 WCE 的特定领域视觉语言表示学习框架。 CapCLIP 将胶囊内窥镜框架与源自标准化命名法和病理感知标题模板的基于临床的文本描述对齐,从而学习语义上知情且可转移的嵌入。使用未见过的 WCE 数据集在严格的零样本条件下针对相关开源视觉和视觉语言基础模型对所提出的框架进行评估。评估涵盖三个下游任务:K 最近邻分类、CLIP 式图像文本分类和文本到图像检索。在这些设置中,CapCLIP 始终优于比较的基线,尤其是在零样本图像文本分类和分布外数据集的跨模式检索方面取得了显着的进步。结果表明,语言引导的表示学习可以提高 WCE 分析中的泛化性和语义可解释性。这些发现使 CapCLIP 成为迈向胶囊内窥镜基础模型的一步,并支持基于语言的 WCE 分析的使用。