论文

SDDF:用于开放词汇伪装物体检测的特异性驱动动态聚焦

SDDF: Specificity-Driven Dynamic Focusing for Open-Vocabulary Camouflaged Object Detection

应用与实践视觉感知与空间理解

摘要

开放词汇对象检测(OVOD)旨在通过利用文本提示来检测开放世界中的已知和未知对象。受益于大规模视觉语言预训练模型的出现,OVOD展现了强大的零样本泛化能力。然而,在处理伪装物体时,由于物体和背景的视觉特征高度相似,检测器常常无法区分和定位物体。为了弥补这一差距,我们通过使用细粒度的文本描述来增强精心选择的伪装对象图像,构建了一个名为 OVCOD-D 的基准。由于可用的伪装目标数据集的规模有限,我们采用在大规模目标检测数据集上预先训练的检测器作为我们的基线方法,因为它们具有更强的零样本泛化能力。在多模态大型模型生成的特异性感知子描述中,仍然存在令人困惑和过度装饰的修饰符。为了减轻这种干扰,我们设计了一种子描述主成分对比融合策略,以减少噪声文本成分。此外,为了解决伪装物体的视觉特征与周围环境高度相似的挑战,我们提出了一种特异性引导的区域弱对准和动态聚焦方法,旨在增强探测器从背景中区分伪装物体的能力。在开放集评估设置下,该方法在 OVCOD-D 基准上获得了 56.4 的 AP。