论文
更好、更强、更快、更广泛:基于 MLLM 的分割的结构化全掩模预测
Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
摘要
基于 MLLM 的分割面临着核心分割三难:高分割性能、保留对话能力和快速推理。嵌入预测方法可能会通过像素级目标破坏语言建模,而下一代词元生成对于密集掩模来说效率低下。我们提出全掩模预测,将自回归对话与非自回归掩模预测解耦。其二进制实例化 STAMP(同时文本全掩模预测)发出词汇内 <SEG> 触发器,将图像对齐的掩模标记与相应的补丁特征融合,并使用混合注意力一次性将所有标记分类为前景或背景。因此,它将强大的引用和推理分割与保留的多模态能力和高效的推理结合起来。然而,如果没有重复的特定目标预测,二进制掩码无法保留多个语义或实例身份。因此,我们提出结构化全掩模预测并开发STAMPlus。它生成一个具有显式 ID 和可选框的目标列表,将这些 ID 绑定到共享的多类掩码空间,并在一次非自回归过程中联合预测所有目标。单个统一检查点保留了 STAMP 的引用和推理功能,同时扩展到开放词汇语义、实例感知和遥感小目标分割,其中高分辨率掩模词元缩放保留了更精细的空间证据。在这些设置中,STAMPlus 实现了最先进的分段性能,保留了一般的多模式指令遵循,并将 12 类别延迟从重复 STAMP 推理的 13.50 秒减少到 5.16 秒。进一步的分析表明,准确的目标线索可以改善分割,并且学习的空间基础有利于双重推理。总体而言,STAMPlus 解决了单目标预测之外的三难困境。