论文

MedPlex:深度视觉-语言协同适应临床基础的医学细分

MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation

模型训练监督微调与指令调优

摘要

尽管临床解释通常依赖于解剖学、位置、外观和周围环境的文本知识,但医学图像分割在很大程度上仍然被视为仅视觉问题。视觉语言模型(VLM)范式中现有的文本引导分割方法通常仅使用语言作为后期条件信号,限制了其对视觉表示学习的影响。我们引入了 MedPlex(视觉和语言医学丛),这是一种端到端的 VLM 框架,使文本指导成为分段学习的连续的、基于临床的组成部分。通过 Bi-Fusion(双向融合),视觉和文本表示在编码层次结构中共同发展。 MedPlex 进一步引入了类级和区域级概念对齐,以互补的粒度组织共享表示。类别级对齐将每个解剖目标锚定到聚合的临床概念概况,而区域级对齐通过特定于类别的视觉证据保留单个概念,例如形状、位置、外观和纹理。通过这种方式,语言在整个编码器中提供结构化监督,而不是仅充当后期提示。 MedPlex 在多器官、心脏亚结构和肿瘤分割的 CT 和 MR 基准上实现了最先进的性能,包括具有真实自由文本临床监督的设置。代码:https://github.com/rafiibnsultan/MedPlex。