论文

FlowOVD:学习用于零样本开放词汇检测的生成潜在流

FlowOVD: Learning Generative Latent Flows for Zero-shot Open-vocabulary Detection

模型推理解码与生成控制

摘要

开放词汇目标检测(OVD)通过大规模视觉语言 预训练 取得了显着进展。然而,现有方法通常将 OVD 表述为判别性预测问题,其中解码器查询要么是静态的,要么是根据编码器特征初始化的,从而限制了它们的多样性和灵活性。在本文中,我们通过将解码器查询生成建模为潜在空间中的连续传输过程来引入生成视角。我们提出了 FlowOVD,一种基于修正流的文本条件查询生成框架,可逐步将文本不可知的查询转换为文本引导的查询。通过将连续潜在查询动态引入基于视觉语言模型(VLM)的检测器,我们的方法避免了启发式离散查询构造,并为开放词汇检测提供了更具表现力的语义对齐。在不需要额外训练数据的情况下,FlowOVD 在 COCO 上达到 49.5 AP,在 LVIS 上达到 31.5 AP,分别比 GroundingDINO 高出 +1.2 AP (+2.5%) 和 +4.1 AP (+15.0%)。在具有挑战性的长尾 LVIS 基准上获得的更大收益进一步凸显了连续查询生成对于开放词汇泛化的有效性。