论文
PET-DINO:以提示增强训练将视觉线索纳入Grounding DINO
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training
摘要
开放集对象检测 (OSOD) 能够识别固定类别之外的新类别,但在将文本表示与复杂的视觉概念对齐以及稀有类别的图像文本对的稀缺方面面临挑战。这会导致专门领域或复杂对象的性能不佳。最近的视觉提示方法部分解决了这些问题,但通常涉及复杂的多模式设计和多阶段优化,从而延长了开发周期。此外,数据驱动的 OSOD 模型的有效训练策略在很大程度上仍未得到探索。为了应对这些挑战,我们提出了 PET-DINO,这是一种支持文本和视觉提示的通用检测器。我们的对齐友好视觉提示生成 (AFVPG) 模块建立在先进的文本提示检测器的基础上,解决了文本表示指导的局限性并缩短了开发周期。我们引入了两种提示丰富的训练策略:迭代级别的批内并行提示(IBP)和整体训练级别的动态内存驱动提示(DMD)。这些策略可以同时对多个提示路线进行建模,从而促进与不同的现实世界使用场景的并行对齐。综合实验表明,PET-DINO 在各种基于提示的检测协议中表现出有竞争力的零样本目标检测能力。这些优势可以归因于基于继承的哲学和即时丰富的训练策略,它们在构建有效的通用对象检测器中发挥着关键作用。项目页面:https://fuweifuvtoo.github.io/pet-dino。