论文

ActiveSAM:使用 Frozen SAM 3 进行快速准确的开放词汇语义分割

ActiveSAM: Fast and Accurate Open-Vocabulary Semantic Segmentation with Frozen SAM 3

应用与实践视觉感知与空间理解

摘要

Segment Anything Model 3 (SAM 3) 为概念提示分割提供了强大的冻结骨干,但将其直接应用于开放词汇语义分割 (OVSS) 效率很低:全分辨率解码通常在整个数据集词汇上运行,而每个图像仅包含一小部分活跃的类子集。我们推出 ActiveSAM,这是一个 无需训练 推理框架,可将 SAM 3 转变为主动词汇分段器。 ActiveSAM 首先规范化并扩展类别提示,然后使用按证据分配定位工作从低分辨率存在预览中估计图像调节的活动集。只有保留的提示才能接收全分辨率掩模预测,使用桶式提示复用与冻结的 SAM 3 解码器。预览阶段仅使用类存在证据并跳过不必要的分段头计算。为了解决重叠的概念响应,排他概念解码将每个像素的联合得分向量与来自未标记图像的每个词汇估计一次的类签名进行比较。 ActiveSAM 不需要权重更新,不需要预言机类存在标签,也不需要每个数据集的超参数调整。在八个 OVSS 基准测试中,ActiveSAM 改进了 无需训练 开放词汇语义分割的速度与准确性权衡,平均比当前最先进的 SegEarth-OV3 提高了 2.1 mIoU,同时运行速度更快,在大词汇数据集上加速了 7.3-12.2 倍。 ActiveSAM 还在模拟真实世界分布变化的图像损坏情况下实现了最高的准确度,使其非常适合部署在自动驾驶和嵌入式人工智能等噪声输入领域。代码可在 https://github.com/VILA-Lab/ActiveSAM 获取