论文
MedP-CLIP:具有区域感知提示集成的医疗 CLIP
MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration
摘要
对比语言-图像预训练(CLIP)通过大规模文本-图像对齐在全局图像理解和零样本传输方面表现出了出色的性能。然而,医学图像分析的核心往往在于对特定解剖结构或病变区域的细粒度理解。因此,准确理解医疗专业人员或感知模型提供的感兴趣区域(RoI)信息变得至关重要。为了满足这一需求,我们提出了 MedP-CLIP,一种区域感知的医学视觉语言模型(VLM)。 MedP-CLIP创新性地整合医学先验知识,设计了特征级区域提示整合机制,使其能够灵活响应各种提示形式(例如点、边界框、掩模),同时在关注局部区域的同时保持全局上下文感知。我们在精心构建的大规模数据集(包含超过 640 万张医学图像和 9730 万个区域级注释)上对模型进行预训练,使其具备跨疾病、跨模态的细粒度空间语义理解能力。实验表明,MedP-CLIP 在各种医疗任务中显着优于基线方法,包括零样本识别、交互式分割和增强多模态 大语言模型。该模型为医疗人工智能提供了可扩展、即插即用的视觉主干,将整体图像理解与精确的区域分析相结合。