论文

ΔRepresentation:通过反事实解剖参照学习病灶表征

$Δ$Representation: Geometry Supervised Representation Learning of Phenotypes via Counterfactual Reasoning for Medical VLMs

模型训练应用与实践监督微调与指令调优行业应用通用理解与问答

摘要

医学视觉语言模型 (VLM) 在放射图像解读方面显示出越来越大的潜力。医学 VLM 将放射图像编码为视觉表示,捕获解剖和表型信息以进行诊断。现有方法通过语义引导的表示对齐来改善病理表型表示。然而,病理表型是随着病变特异性视觉变化叠加在基础正常解剖结构上而出现的。这种语义对齐方法无法对相对于相应正常解剖表示的表型特异性增量进行建模。为了解决这一差距,我们提出了 \textbf{$Δ$Representation},这是一种基于医学 VLM 反事实推理的视觉表型表示学习框架。它包括 \textbf{BaseAnatomy}(几何监督表示学习模块)和 \textbf{$Δ$Phenotype}(反事实增量表示学习模块)。 BaseAnatomy 通过解剖结构之间和内部的空间关系提供细粒度的几何监控。 $Δ$表型计算病变表示与其相应的正常解剖表示之间的表示增量,并监督与相同表型相关的增量在表示空间中聚类。 \textit{ReXGroundingCT} 和 \textit{LIDC-IDRI} 上的实验表明,$Δ$Representation 有效地构建了病理表型表示,并提高了医学 VLM 中病变Grounding和表型表征的准确性。代码可在 https://anonymous.4open.science/r/deltarep-CF6D。 获取

ΔRepresentation:通过反事实解剖参照学习病灶表征:论文原图
图 2:Δ\DeltaRepresentation 概述。 (a) BaseAnatomy 塑造了一个具有理想几何监督的解剖结构视觉空间,对解剖关系和空间连续性进行编码。 (b) Δ\DeltaPhenotype 为病变斑块构建反事实正常参考,并学习相对于正常解剖结构的表型特异性视觉增量,以进行区分表型表示学习。