论文

胃腺癌分类的多模态知识蒸馏

Multimodal Knowledge Distillation for Gastric Adenocarcinoma Classification from Whole-Slide Images

摘要

胃腺癌 (GA) 是全球癌症相关死亡的主要原因,从全切片图像 (WSI) 中进行准确的组织病理学亚型分类对于有效的治疗计划至关重要。虽然将病理报告文本与 WSI 集成的多模态方法可以改进分类,但现有方法通常依赖于计算成本昂贵的Transformer架构和大语言模型。我们提出了一种多模态知识蒸馏(MKD)框架,该框架使用低秩多模态融合(LMF)将预训练的 WSI 图像编码器和临床文本编码器结合起来,以有效地建模训练期间的跨模态交互。每个 WSI 都表示为一组图像块,并配有切片级诊断描述。 教师模型学习用于子类型分类的融合图像文本表示,而 学生模型则提取这些知识以实现准确的仅图像推理。我们在 PatchGastric 基准数据集上评估我们的方法,并且在不依赖基于 Transformer 的融合、多任务学习或 大语言模型 的情况下,平均准确度比最先进的方法高出至少 3.35%。源代码可在 https://github.com/helomelo1/MKD-LMF. 获取

胃腺癌分类的多模态知识蒸馏:论文原图
图 1:所提出的两阶段 MKD-LMF 框架概述。 WSI 补丁经过编码和均值池化以获得袋级图像表示 $(\mathbf{z}_{img})$,而相应的标题通过文本编码器传递以提取文本特征 $(\mathbf{z}_{txt})$。在第一阶段,教师模型 网络采用低秩多模态融合 (LMF) 模块来组合 $(\mathbf{z}_{img})$ 和 $(\mathbf{z}_{txt})$,生成融合表示 $(\mathbf{z}_{fused})$,用于训练用于胃腺癌 (GA) 亚型分类的线性分类器(与 学生模型 共享)。在第 2 阶段,学生模型 网络仅采用 $(\mathbf{z}_{img})$ 作为输入,并通过线性知识蒸馏模块进行学习,以近似由 教师模型 的冻结 LMF 模块生成的 $\mathbf{z}_{fused}$。然后将合成的表示传递给共享分类器以实现仅图像 GA 子类型分类。