论文
用于开放式临时分割的视觉利用代理
Vision Harnessing Agent for Open Ad-hoc Segmentation
摘要
当概念已知时,分割就变得很容易,需要从文本中检索学到的视觉基础。对于开放的临时概念来说仍然很困难,其中的基础可能不作为一种习得的面具而存在,并且通常必须通过部分、关系、排除和集合从图像证据构建。我们提出了一种视觉引导的临时分割代理(VASA),这是第一个用于开放临时分割的视觉利用代理。 VASA 是 无需训练,结合了 VLM 代理、分段基础模型和视觉工具,该工具维护工作遮罩以使视觉进度持久、可检查和可编辑。它不是单独修改文本提示,而是规划可视化操作、调用分段工具、检查结果、编辑掩码并从错误中恢复。我们构建了 PARS,这是一个新的基准,可通过长格式定义查询将零件级标签转变为开放的临时概念。我们证明,VASA 在具有不同功能的六个 VLM 中始终有效。使用 Qwen3-VL 32B Thinking 作为 VLM,VASA 在 PARS 上的各种基线表现均优于 SAM3 Agent 13.5%-25.3%。在 RefCOCOm 上,VASA 比 SAM3 Agent 提高了 4.8%-8.8%,比其他代理基线提高了更多。 VASA 在 ReasonSeg 上的通用命名概念方面仍与 SAM3 Agent 保持竞争。这些结果验证了 VASA 用于开放式临时分割的代理视觉构造。