论文

SparseSAM:分段任意模型中激活的结构化稀疏化

SparseSAM: Structured Sparsification of Activations in Segment Anything Models

模型优化稀疏化

摘要

Segment Anything Model (SAM) 实现了强大的开放词汇分割,但其基于 ViT 的图像编码器在推理延迟和内存方面占主导地位。现有的激活压缩方法(例如词元合并)减少了要处理的词元长度,但会引入不小的运行时开销,并在高压缩下遇到灾难性的质量下降。其他应用稀疏注意力的方法仅关注注意力,使 MLP 完全密集并限制可实现的加速。我们提出了 SparseSAM,这是一种 (i) 无需训练 结构化稀疏化框架,可共同加速注意力和 MLP 层,同时保留词元身份。 SparseSAM 引入了 (ii) Stripe-Sort Attention,它使用确定性 Z 顺序排列将密集注意力转换为静态硬件友好的稀疏模式,从而消除动态屏蔽开销。 SparseSAM 进一步引入了 (iii) 残差一致性 MLP,它仅通过 MLP 路由信息性标记,同时通过残差路径传播剩余标记。在四个分割基准中,SparseSAM 在 0.4 密度下仅损失 0.004 mIoU,在 0.3 密度下仅损失 0.021 mIoU,与词元合并进步相比,精度损失减少了 2.10 倍,同时推理速度提高了 2 倍,内存减少了 2.8 倍。