论文

PathSelect:整个载玻片病理学的顺序标记选择

PathSelect: Sequential Token Selection for Whole Slide Pathology

上下文与知识上下文工程

摘要

由于极端的序列长度,十亿像素全幻灯片图像 (WSI) 为视觉语言模型 (VLM) 带来了基本的计算瓶颈。现有方法主要依赖于空间采样或 无需训练 修剪,这有稀释微弱但信息丰富的信号的风险,由于病理线索的空间扩散性质,导致关键诊断证据的丢失。我们将 WSI 词元修剪重新表述为顺序选择过程,使模型能够自主学习最佳路由策略,而不是依赖静态启发法。我们在此提出了一个解耦路由框架,作为活动插件集成到完全预训练的 SlideChat 基本模型中,使滑动编码器和 大语言模型 都冻结。为了在训练期间为不可微剪枝操作提供连续梯度,我们引入了 PathSelect。 PathSelect 采用保留方差的噪声门,通过可微分的 Soft Top-K 算子来调制每个补丁的信息流,并与对角注意力降噪器配对,可在没有语义泄漏的情况下恢复扰动的表示。由此推断,PathSelect 模块是完全分离的。仅依靠经过训练的记分器,确定性 Hard Top-K 算子执行自适应、数据相关的轨迹终止,从而显着加速下游生成处理,并具有极低的顺序词元选择延迟。在最大约束 K = 128 下仅 44.86 个词元的经验平均值的驱动下,我们的框架在 SlideBench (TCGA) 上实现了 74.00% 的总体准确率,这意味着相对于未压缩的基线平均值,空间词元减少了大约 36.6 倍,同时始终优于基于采样的对应框架。