论文

AnchorSeg:用于推理分段的基于语言的查询库

AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation

应用与实践视觉感知与空间理解

摘要

推理分割需要模型将复杂的隐式文本查询转化为精确的像素级掩模。现有方法依赖于单个分割标记 $\texttt{<SEG>}$,其隐藏状态隐式编码语义推理和空间定位,限制了模型显式区分分割内容和分割位置的能力。我们引入了 AnchorSeg,它将推理分割重新表述为基于图像标记的结构化条件生成过程,以基于语言的查询库为条件。 AnchorSeg 不是将所有语义推理和空间定位压缩为单个嵌入,而是构建了查询库的有序序列:捕获中间语义状态的潜在推理标记,以及提供显式空间基础的分段锚标记。我们将空间条件建模为图像标记上的因子分布,其中锚查询确定定位信号,而上下文查询提供语义调制。为了桥接 词元级 预测和像素级监督,我们提出了词元-掩模循环一致性(TMCC),这是一种强制跨分辨率对齐的双向训练目标。通过基于结构化语言的查询库显式地将空间基础与语义推理解耦,AnchorSeg 在 ReasonSeg 测试集上取得了最先进的结果(67.7\% gIoU 和 68.1\% cIoU)。所有代码和模型均可在 https://github.com/rui-qian/AnchorSeg 上公开获取。