论文
通过对比学习进行超声视觉语言对齐
Ultrasound Vision-Language Alignment via Contrastive Learning
摘要
超声基础模型在结构化预测任务上取得了强大的性能,但仍然完全基于视觉,限制了零样本和少样本迁移到任务特定注释稀缺的新任务。我们通过 EchoCare-CLIP 解决了这一差距,这是一种 CLIP 风格的双编码器对比框架,可在共享嵌入空间中将超声图像与临床文本对齐。我们整理了一个由超过 16K 个图像文本对组成的多器官语料库,涵盖乳房、肝脏、肺和甲状腺,其中超过 78% 的字幕来自专家注释的报告,并通过基于三层模板和基于 LLM 的字幕生成管道来补充其余部分。我们根据 OpenAI CLIP 和 BiomedCLIP 基线评估跨越两个文本编码器系列(CLIP、BioClinicalBERT)和两种字幕策略(基于模板、LLM 生成)的模型配置。我们经过训练的模型在基线上持续改进跨模式对齐,最佳配置实现了 0.682 的配对对齐分数。然而,更强的对齐并不能保证更好的下游性能:具有部分 微调 的基于 CLIP 的变体在外部保留数据集上实现了最强的零样本分类(BUSI 上为 0.709;AULI 上为 0.626),而完整的端到端 微调 由于过度拟合而降低了传输性能。在线性探测和少样本适应方面,模型排名取决于数据集,反映了领域适应和代表性概括性之间的权衡。我们进一步表明,基于模板的字幕匹配或优于 LLM 生成的字幕,这表明词汇多样性并不能代表字幕质量。总而言之,我们的结果表明,仅通过公共数据就可以实现超声视觉-语言对齐,但强大的临床转移需要仔细平衡领域适应、编码器容量和字幕监督质量。