论文

SlideMix:通过多模式改组增强整个幻灯片图像分析

SlideMix: Enhancing Whole Slide Image Analysis via Multimodal Shuffling

模型训练合成数据

摘要

组织病理学全切片图像 (WSI) 是癌症诊断的核心,但其十亿像素规模、组织异质性、薄弱的切片级监督、稀疏的诊断区域和多尺度证据使得稳健的自动化分析具有挑战性。多实例学习 (MIL) 广泛用于将图块级特征聚合到幻灯片级预测中,但现有的增强策略经常扰乱组织区域,而无法保留诊断相关性、幻灯片上下文或跨尺度结构。我们提出了 SlideMix,这是一种与模型无关的多模式增强框架,用于基于 MIL 的 WSI 分析。 SlideMix 使用基于检索增强视觉语言模型 (VLM) 的视觉语言自适应区域选择器来识别诊断相关区域并减少弱标签噪声。然后,它在有意义的组织区域内执行就地平铺洗牌,以混合特征嵌入,同时保留幻灯片级别的上下文。基于VLM的软标签模块监督混合样本,而多因素、损失驱动的在线课程学习反馈方案自适应地控制洗牌粒度、特征相似性和洗牌比率,以促进跨尺度表示学习。在 11 个 WSI 数据集(包括 20,523 个幻灯片、8 个诊断任务和 10 个 WSI 主干)中,SlideMix 提高了大多数设置的准确性和泛化性,并且与已建立的增强基线相比具有优势,为更强大和可扩展的数字病理学模型提供了简单的即插即用方法。源代码:https://github.com/Xia-Research-Lab/SlideMix