论文
SGMA:面向超高分辨率科学图像的结构引导掩码预训练
Structure-Guided Masked Autoencoders for Ultra-High Resolution Scientific Image Understanding
摘要
使用视觉Transformer(包括掩模自动编码器(MAE))进行自监督预训练很难应用于十亿像素科学图像。随机掩码与科学数据的结构化、多尺度形态的匹配度很差,而统一标记化会产生过长的序列,使得 $O(N^2)$ 注意力不切实际。我们提出了 SGMA,一种用于超高分辨率科学图像的结构引导掩模自动编码框架。 SGMA 结合了两个组件:一个内容自适应四叉树分词器,将十亿像素图像压缩为固定长度的序列;以及一个结构条件掩蔽过程,该过程使重建偏向于空间信息区域。为了在尺度上稳定这个过程,我们引入了阻尼累积(DA),它将整个树上的信号相关响应聚合到一个用于指导掩蔽的结构画布中。由此产生的预训练任务保留了精细的微观结构,同时保持与标准 ViT 编码器和 MAE 式重建的兼容性。在电子显微镜、全玻片光学显微镜和 X 射线 CT 数据集上,SGMA 始终优于 MAE 基线。它在 8K x 8K x 28K SpringXCT 数据集上实现了 95.68% Dice,比相同架构的 MAE 基线提高了 13.00 点;在 32K^2 WSI PAIP 数据集上实现了 83.21% Dice,提高了 16.84 点,同时提供高达 24.8 倍的推理加速。
