论文

Tarot-SAM3:用于任何引用表达式分割的 无需训练 SAM3

Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation

应用与实践视觉感知与空间理解

摘要

参考表达分割(RES)旨在分割自然语言表达描述的图像区域,作为视觉和语言理解之间的桥梁。然而,现有的 RES 方法严重依赖于大型注释数据集,并且仅限于显式或隐式表达式,这阻碍了它们泛化到任何引用表达式的能力。最近,Segment Anything Model 3 (SAM3) 在即时概念分割方面表现出了令人印象深刻的稳健性。尽管如此,将其应用于 RES 仍然具有挑战性:(1) SAM3 难以处理较长或隐式的表达式; (2) SAM3 与多模态 大语言模型 (MLLM) 的简单耦合使得最终结果过度依赖于 MLLM 的推理能力,而无法细化 SAM3 的分段输出。为此,我们提出了 Tarot-SAM3,这是一种新颖的 无需训练 框架,可以准确地从任何指称表达中进行分段。具体来说,Tarot-SAM3 由两个关键阶段组成。首先,表达式推理解释器 (ERI) 阶段引入推理辅助提示选项,以支持结构化表达式解析和评估感知改写。这将任意查询转换为强大的异构提示,以便使用 SAM3 生成可靠的掩码。其次,掩模自精炼 (MSR) 阶段在提示类型中选择最佳掩模,并通过利用 DINOv3 中丰富的特征关系来比较 ERI 输出之间的判别区域来执行自精炼。然后,它推断区域与目标的隶属关系,从而纠正过度分割和分割不足。大量实验表明,Tarot-SAM3 在显式和隐式 RES 基准以及开放世界场景上均取得了出色的性能。消融研究进一步验证了每个阶段的有效性。