论文

用于增强开放词汇对象检测的参数高效语义增强

Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection

模型训练参数高效训练

摘要

开放词汇对象检测 (OVOD) 使模型能够检测任何对象类别,包括看不见的对象类别。受益于大规模的预训练,现有的OVOD方法在一般场景(例如OV-COCO)上实现了强大的检测性能,但当转移到具有大量域转移的下游任务时,性能会严重下降。这种退化源于特定领域任务中类别标签的稀缺性和弱语义,以及现有模型无法捕获粗粒度类别标签之外的辅助语义。为了解决这些问题,我们提出了 HSA-DINO,一种参数高效的语义增强框架,用于增强开放词汇对象检测。具体来说,我们提出了一个多尺度提示库,它利用图像特征金字塔来捕获分层语义并选择特定领域的局部语义提示,从粗粒度到细粒度级别逐步丰富文本表示。此外,我们引入了一种语义感知路由器,可以在推理过程中动态选择适当的语义增强策略,从而防止参数更新降低预训练 OVOD 模型的泛化能力。我们在 OV-COCO、几个垂直域数据集和修改后的基准设置上评估 HSA-DINO。结果表明,HSA-DINO 的性能优于之前最先进的方法,在领域适应性和开放词汇泛化之间实现了卓越的权衡。