论文
TinySAM 2:用于高效跟踪任何模型的极端记忆压缩
TinySAM 2: Extreme Memory Compression for Efficient Track Anything Model
摘要
Segment Anything Model 2(SAM 2)是视频分割领域的核心基础模型。它在原始 SAM 模型的基础上引入了内存库机制,并在半监督视频对象分割和跟踪等任务中展示了出色的性能。然而,SAM 2的多级图像编码器和存储模块的复杂计算特性给模型在实际应用中的部署带来了障碍。为了解决这个问题,我们提出了TinySAM 2,一种平衡性能和效率的轻量级视频分割模型。首先,引入记忆质量管理机制,选择并保留高信息量的历史帧作为记忆。此外,提出了联合时空词元压缩,以减少内存存储和计算成本。具体来说,采用平均池化首先压缩空间域中的冗余标记。在时域中,基于 词元级 相似性测量在存储库中跨帧选择信息标记。此外,我们采用RepViT作为轻量级图像编码器,进一步减少了模型参数。在 DAVIS 和 SA-V 等具有挑战性的数据集上进行的大量实验表明,TinySAM 2 仅需 7% 的内存词元和 3% 的训练数据即可实现 SAM 2.1 90% 的性能。这项研究有效缓解了与 SAM 2 相关的参数计数、计算负载和部署成本方面的瓶颈,为视频分割模型在设备上的广泛应用提供了资源高效的解决方案。