论文
Seg-Agent:无需训练 语言引导分割的测试时多模态推理
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
摘要
语言引导分割超越了传统语义分割的范围限制,使模型能够基于自然语言指令分割任意目标区域。现有方法通常采用两阶段框架:使用多模态 大语言模型 (MLLM) 来解释指令并生成视觉提示,然后使用基础分割模型(例如 SAM)来生成掩模。然而,由于现成的 MLLM 的空间空间定位能力有限,这些方法通常依赖于大规模数据集的广泛训练才能达到令人满意的精度。虽然最近的进展引入了推理机制来提高性能,但它们主要在文本领域内运行,仅基于抽象文本表示来执行思想链推理,而没有直接的视觉反馈。在本文中,我们提出了 Seg-Agent,这是一个完全 无需训练 框架,开创了显式多模式推理链。与之前的纯文本推理不同,我们的方法构建了一个交互式视觉推理循环,包括三个阶段:生成、选择和细化。具体来说,我们利用标记集 (SoM) 视觉提示将候选区域直接渲染到图像上,使 MLLM 能够“看到”并迭代地推理视觉域中的空间关系,而不仅仅是文本关系。这种显式的多模态交互使 Seg-Agent 能够实现与最先进的基于训练的方法相当的性能,而无需任何参数更新。此外,为了全面评估不同场景的泛化能力,我们引入了Various-LangSeg,这是一个涵盖显式语义、通用对象和推理引导分割任务的新颖基准。大量的实验证明了我们方法的有效性和鲁棒性。