论文
SAM3-LiteText:面向高效视觉-语言分割的SAM3文本编码器解剖研究
SAM3-LiteText: An Anatomical Study of the SAM3 Text Encoder for Efficient Vision-Language Segmentation
摘要
诸如SAM3的视觉-语言分割模型支持灵活的、提示驱动的视觉定位,但继承了最初为开放式语言理解设计的大型通用文本编码器。在实践中,分割提示短小、结构化且语义受限,导致文本编码器容量大量过剩以及持续的计算与内存开销。本文对视觉-语言分割中的文本提示进行大规模解剖分析,覆盖多个基准上的404,796条真实提示。我们的分析揭示出严重冗余:大多数上下文窗口未被充分利用,词表使用高度稀疏,文本嵌入尽管表示维度很高却位于低维流形上。基于这些发现,我们提出SAM3-LiteText,一个轻量文本编码框架,用经知识蒸馏优化的紧凑MobileCLIP学生模型替换原始SAM3文本编码器。在图像与视频分割基准上的大量实验表明,SAM3-LiteText将文本编码器参数最多减少88%,显著降低静态内存占用,同时保持与原始模型相当的分割性能。代码:https://github.com/SimonZeng7108/efficientsam3/tree/sam3_litetext 。
