论文

SCALPEL:通过 LLM 支持的编码器学习进行语义跨模态对齐,用于医学视觉语言表示

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

模型训练预训练

摘要

视觉语言 预训练 (VLP) 是医学多模态表示学习的基石。然而,在处理冗长、术语密集的临床报告时,现有的医学 VLP 框架通常受到有限的上下文窗口和轻量级文本编码器的浅层表示能力的限制。虽然集成医学 大语言模型 (LLM) 提供了前所未有的临床推理能力,但它引入了三个主要瓶颈:(i) 标准对比目标下生成式 LLM 的各向异性表征崩溃,(ii) 大批量联合端到端训练的内存开销过高,以及 (iii) 忽略细粒度解剖学的普通对比损失引起的医学幻觉偏侧性和否定修饰语。为了应对这些挑战,我们提出了 \textbf{SCALPEL},一个通过 \textbf{L}LM-\textbf{P} 提供 \textbf{E}ncoder \textbf{L} 收益的 \textbf{S} 语义 \textbf{C}ross-modal \textbf{A} 对齐框架。首先,临床报告对比 微调 通过特定领域的临床文本适应将生成式 LLM 转换为各向同性编码器。其次,非对称对齐策略利用离线特征缓存来实现高效的训练。至关重要的是,我们制定了一个解剖否定感知目标,明确惩罚涉及偏向性混淆或错误否定的不匹配图像文本对。 MIMIC-CXR、CheXpert 和 IU X-Ray 基准的大量实验表明,SCALPEL 在跨模式检索、零样本疾病分类和医学视觉问答方面实现了最先进的性能。