论文
InstructSAM:使用任何指令对任何实例进行分段
InstructSAM: Segment Any Instance with Any Instructions
摘要
在本文中,我们介绍了InstructSAM,这是一个统一且精简的框架,专为任意指令下的多实例分割而设计。我们将指令驱动的实例分割表述为集合结构查询预测问题,并提出了一个显式推理到实例查询接口,该接口完美地连接了视觉语言模型 (VLM) 和 SAM3。具体来说,一组可学习的实例查询被注入到 VLM 中,并通过指令和视觉信息进行上下文化,使每个查询都能够充当实例感知槽。混合注意力机制进一步促进这些查询、视觉标记和指令标记之间的交互,改进实例枚举并减少重复预测。生成的 LLM 条件查询被投影到 SAM3 的检测器查询空间中,以在单次前向传递中驱动准确的多实例分段。该设计使 SAM3 具备高级指令理解、组合推理和实例级集合预测功能,而无需修改其核心架构。为了支持训练和评估,我们进一步构建了 Inst2Seg,这是一个高质量、大规模的基于指令的实例分割数据集和基准,将自由格式指令与实例级掩码相结合。大量实验表明,只有 2B 规模的 InstructSAM 在复杂的指令驱动和短语级引用分段基准测试中取得了出色的结果,优于先前的端到端方法和 SAM3 的代理管道,同时实现高效的单通道多实例预测。