论文
PureVision:医学视觉语言模型的几何监督病灶表征
Geometry-Supervised Visual Representation Learning for Multi-Phenotype Lesion Interpretation in Medical VLMs
摘要
医学视觉语言模型 (VLM) 在临床图像解释方面显示出越来越大的潜力。然而,这些模型仍然难以解释多表型病变,其诊断需要对多种病理表型进行联合评估。现有的视觉语言对齐方法产生的视觉表示无法保留解剖层次结构和表型子类之间的关系。这源于它们对语义监督的依赖,而语义监督缺乏几何约束来保存视觉嵌入空间中的这些关系。此外,与病变相关的解剖和表型表征的稀疏性使得医学 VLM 很难捕获重要的诊断证据。为了解决这些限制,我们提出了 \textbf{PureVision},这是一种几何监督视觉表示学习框架,用于医学 VLM 中的多表型病变解释。它结合了几何监督表示学习模块 \textbf{PureEyes} 和解剖学引导证据聚合模块 \textbf{PureNeurons}。纯眼 通过编码解剖层次结构和表型子类关系的理想空间分布提供几何监督。 PureNeurons 将视觉表征投射到学习的潜在空间中,利用它们的位置选择性地聚合特定病变的解剖和表型证据。 \textit{LIDC-IDRI}、\textit{CBIS-DDSM} 和 \textit{3DReasonKnee} 上的实验表明,PureVision 改善了视觉问答和放射学报告生成中的病变基础和表型表征。代码可在以下位置获取:https://anonymous.4open.science/r/purevision-06C2。
