论文

一个图块,多个实例:重新思考稀疏诊断证据的 MIL

One Tile, Multiple Instances: Rethinking MIL for Sparse Diagnostic Evidence

应用与实践视觉感知与空间理解

摘要

在弱监督的整个幻灯片图像(WSI)分类中,特征提取器通常将每个图像块压缩为单个全局嵌入。因此,滑动级聚合器仅限于这种粗瓦片规模,从注意机制中隐藏了细粒度的子瓦片证据。我们引入 DI-MIL,这是一个通过分解实例将编码上下文与实例粒度解耦的框架。通过对每个图块内的冻结基础模型中的密集空间token进行聚类,DI-MIL 将单个图块转换为多个独立加权的实例嵌入。作为无需训练后编码模块,DI-MIL 无缝集成到现有管道中,无需重新编码或下游架构修改。我们在细胞病理学上评估 DI-MIL,这是一个具有挑战性的测试平台,稀疏的诊断信号很容易在标准瓷砖中稀释。在四个数据集、三个冻结基础模型和两个基于注意力的聚合器中,DI-MIL 表现出一致的功效,改进了 72 个指标级别比较中的 67 个,在细胞病理学特定的骨干模型下最大平均增益达到 3.64 点。在与七个代表性 MIL 基线的更广泛比较中,DI-MIL 与 ACMIL 配对在 36 个骨干模型数据集指标比较中的 33 个中实现了最高平均性能。 消融表明,直接较小的平铺会使提取的平铺数量增加高达 43.3$\times$,且具有非单调性能,而 DI-MIL 会产生零额外的图像提取开销,同时实现最强的整体结果。这些结果将实例构建确立为 MIL 中的正交设计维度,支持 DI-MIL 作为稀疏诊断证据下的经济高效的解决方案。

一个图块,多个实例:重新思考稀疏诊断证据的 MIL的原论文方法或结果图
图 1:DI-MIL 概述。 (a) 将全玻片细胞病理学图像划分为源图块。 (b) 基于冻结变压器的基础模型从每个图块中提取全局 [CLS] 表示和密集补丁token特征。 (c) DI-MIL 在密集的token表示上执行图块内球形聚类,在每个簇内聚合token,并为每个图块构造多个分解实例。 (d) 所有图块分解后的实例被组装到滑动级 MIL 包中,并由下游 MIL 聚合器进行处理。