论文

利用线性时间状态空间蒸馏视觉基础模型进行高效遥感实例分割

Efficient Remote Sensing Instance Segmentation with Linear-Time State Space Distilled Visual Foundation Models

摘要

Transformer 的计算复杂度与 token 数量呈二次方关系,这极大地限制了视觉模型的效率,特别是在密集预测任务中最近基于 ViT 的基础模型。实例分割是遥感领域典型的密集视觉预测任务,也面临着类似的挑战。在本文中,受大语言模型中知识蒸馏最新进展的启发,我们引入了RS4D——一种具有线性计算复杂度的新型遥感实例分割方法,它通过蒸馏状态空间建模(SSM)解决了长序列建模的低效率问题。我们提出了一种针对 预训练 轻量级 SSM 主干的自适应噪声和掩蔽 知识蒸馏 训练方法,该方法有效地将知识从巨大的自注意力空间压缩到紧凑、密集的线性状态空间中。我们还基于这种轻量级视觉编码器设计了一个遥感图像实例分割架构,其中我们探索了三种不同主干和两个分割头的变体。在 SSDD、WHU 和 NWPU 等多个基准数据集上进行了大量实验。与基于 ViT 的方法相比,我们提出的 SSM 主干网络实现了 8 倍的参数减少和 9 倍的 FLOP 减少,同时保持与基于 ViT 和 CNN 的实例分割方法相当或更高的精度。实现代码已公开在https://github.com/QinzheYang/RS4D。