论文

用于高效千兆像素整个幻灯片图像推理的可学习词元稀疏化

Learnable Token Sparsification for Efficient Gigapixel Whole Slide Image Reasoning

模型推理推理加速

摘要

由于视觉标记数量过多,视觉语言模型中十亿像素整张幻灯片图像的处理面临着重大困难。现有的解决方案通常依赖于无需训练即可操作的空间下采样或启发式修剪策略,并且这些方法经常丢弃微妙但具有临床意义的模式,因为病理证据不规则地分散在组织中。为了克服这个限制,我们将整个幻灯片图像中的标记减少重新表述为可训练的稀疏化问题,使模型能够学习最佳选择策略,而不是遵循固定的启发式。我们提出了一种解耦的路由架构。为了在训练期间通过不可微剪枝操作实现梯度传播,我们引入了一个名为 SparseLearn 的组件。该组件使用保留方差的噪声门,通过可微分的 Soft Top-K 算子来调节每个补丁的信息流,以及对角注意力降噪器,以在不泄漏空间信息的情况下恢复扰动的表示。在推理时,SparseLearn 模块被完全丢弃,并且训练有素的评分器应用确定性 Hard Top-K 运算符仅保留得分最高的 32 个标记,不会产生额外的计算。通过将视觉序列压缩为仅包含 32 个标记的稀疏集合(仅占原始长度的 0.78%),我们的框架在 SlideBench (TCGA) 上实现了 73.32% 的整体准确率,始终超越基于采样的基线和通用视觉语言模型。它还在 SlideBench (BCNB) 和 WSI VQA* 上展示了强大的零样本泛化能力。通过解决视觉上下文瓶颈并防止稀疏诊断证据的稀释,这项工作为端到端十亿像素整个幻灯片图像推理提供了高效的范例。