论文
OPUS:一个简单而有效的开放词汇检测统一框架
OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection
摘要
最近的统一开放词汇检测(OVD)支持异构提示,包括文本查询、视觉样本及其组合,但通常依赖于日益复杂的设计,例如重型跨模式融合、分阶段训练和迭代注释管道。我们重新审视在更强大的基础模型时代,这种复杂性是否必要。我们的发现是,通过语义丰富的视觉表示和可扩展的定位监督,可以使统一的 OVD 变得更加简单。我们提出了 OPUS(\textbf{O}pen-vocabulary、\textbf{P}rompt-\textbf{U}nified、\textbf{S}imple),这是一种统一的检测器,在一个框架内支持文本、交互式视觉、通用视觉和混合提示。 OPUS 采用简单的三部分设计。其模型架构结合了语义丰富的视觉编码器(建立在具有高效混合编码的 DINOv3-ConvNeXt-B 主干基础上)和提示感知解码器,可避免特定于提示的分支以实现统一的提示推理。 OPUS 采用具有实例级对比对齐 (ICA) 的单阶段文本视觉训练策略进行训练,并由基于 SAM3 的单通道数据引擎支持,用于异构定位监督。在 COCO、LVIS-minival 和 ODinW35 上的实验表明,OPUS 实现了最先进的 Visual-I 性能,达到 68.1/69.2/54.7 AP,同时保持平衡的 Text 和 Visual-G 精度。 OPUS 还将混合提示从干扰转变为互补,比单独的文本或视觉提示有所改进。这些结果表明简单性和强大的统一提示能力是可以同时实现的。