论文
一个图块,多个实例:重新思考稀疏诊断证据的 MIL
One Tile, Multiple Instances: Rethinking MIL for Sparse Diagnostic Evidence
摘要
在弱监督的整个幻灯片图像(WSI)分类中,特征提取器通常将每个图像块压缩为单个全局嵌入。因此,滑动级聚合器仅限于这种粗瓦片规模,从注意机制中隐藏了细粒度的子瓦片证据。我们引入 DI-MIL,这是一个通过分解实例将编码上下文与实例粒度解耦的框架。通过对每个图块内的冻结基础模型中的密集空间token进行聚类,DI-MIL 将单个图块转换为多个独立加权的实例嵌入。作为无需训练后编码模块,DI-MIL 无缝集成到现有管道中,无需重新编码或下游架构修改。我们在细胞病理学上评估 DI-MIL,这是一个具有挑战性的测试平台,稀疏的诊断信号很容易在标准瓷砖中稀释。在四个数据集、三个冻结基础模型和两个基于注意力的聚合器中,DI-MIL 表现出一致的功效,改进了 72 个指标级别比较中的 67 个,在细胞病理学特定的骨干模型下最大平均增益达到 3.64 点。在与七个代表性 MIL 基线的更广泛比较中,DI-MIL 与 ACMIL 配对在 36 个骨干模型数据集指标比较中的 33 个中实现了最高平均性能。 消融表明,直接较小的平铺会使提取的平铺数量增加高达 43.3$\times$,且具有非单调性能,而 DI-MIL 会产生零额外的图像提取开销,同时实现最强的整体结果。这些结果将实例构建确立为 MIL 中的正交设计维度,支持 DI-MIL 作为稀疏诊断证据下的经济高效的解决方案。
