论文

VespaSeg:用于引用表达式分割的资源感知地面然后分段管道

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

应用与实践视觉感知与空间理解

摘要

引用表达分割需要语言条件定位和像素精确的掩模,但整体模型的部署成本可能很高。我们推出了 VespaSeg,这是一种模块化管道,它以紧凑的视觉语言模型为基础进行文本查询,并使用 MobileSAM 将预测框转换为掩模。我们研究 Florence-2-base、Florence-2-large 和 Moondream2 定位器,以及定位和分段阶段的有针对性的调整。在包含 3,811 个引用对象记录中每一个记录的第一个表达式的存储库特定的 RefCOCO 验证协议下,改编后的 Florence-2-base 管道在 IoU 0.5 时获得 73.64 的并集平均交集 (mIoU) 和 84.60 的精度。在 NVIDIA RTX 6000 Ada GPU 上,它每秒处理 22.8 个缓存图像查询,平均分配 GPU 内存为 2.20 GB。匹配的 500 个查询比较得出 Florence-2-base 的 mIoU 为 73.73 mIoU,Florence-2-large 的 mIoU 为 72.82,而基本模型的速度快 1.70 倍,并且使用的分配内存减少了 1.17 GB。消融表明,真值 盒适应将 MobileSAM mIoU 从 82.22 提高到 86.61,并且将 Florence-2 输出 词元预算 从 64 减少到 32 保持了准确性。这些结果支持紧凑、模块化的基础和分段,同时还暴露了对完整标准 RefCOCO 表达式分割和部署硬件进行评估的需求。