论文

Qwen3-VL-Seg:通过视觉语言定位实现开放世界指代表达分割

Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding

应用与实践视觉感知与空间理解

摘要

开放世界引用分割需要将不受约束的语言表达对应到精确的像素级区域。现有的多模态 大语言模型 (MLLM) 表现出强大的开放世界视觉基础,但其输出仍然仅限于稀疏边界框坐标,不足以进行密集视觉预测。最近基于 MLLM 的分割方法要么直接预测稀疏轮廓坐标,难以重建连续的对象边界,要么依赖外部分割基础模型,例如分段任意模型 (SAM),从而引入大量的架构和部署开销。我们提出了 Qwen3-VL-Seg,一个参数高效的框架,它将 MLLM 预测框视为基于语义的结构先验,并将其解码为像素级引用分割。其核心是,轻量级框引导掩模解码器结合了多尺度空间特征注入、空间语义查询构造、框引导高分辨率像素融合和迭代掩模感知查询细化,仅引入 17M 个参数(约为基础模型的 0.4%)。对于可扩展的开放世界训练,我们构建了 SA1B-ORS,这是一个由 SA-1B 派生的数据集,具有两个子集:SA1B-CoRS(面向类别的样本)和 SA1B-DeRS(描述性的、特定于实例的样本)。为了进行评估,我们策划了 ORS-Bench,这是一个手动筛选的基准,具有覆盖不同引用表达类型的分布内和分布外子集。关于引用表达分割、视觉基础和 ORS-Bench 的大量实验表明,Qwen3-VL-Seg 在封闭集和开放世界设置中表现强劲,在语言密集型指令和强大的分布外泛化方面具有明显的优势。对通用多模态基准的评估进一步表明,该模型在面向细分的适应之后广泛保留了通用多模态能力。