论文
PISA:用于测试时开放词汇对象检测的伪个体源域特征适应框架
PISA: A Pseudo-Individual Source-Domain Feature Adaptation Framework for Test-Time Open-Vocabulary Object Detection
摘要
开放词汇目标检测测试时间自适应 (OVOD-TTA) 旨在解决预训练基础模型在遇到图像域变化时所遭受的性能下降问题。现有的无源 OVOD-TTA 方法要么依赖于精确的测试时间信息进行重新评分,要么依赖于伪标签进行自我训练,从而在初始预测较差时导致准确性显着下降。同时,大多数传统的源域估计方法恢复适合分类任务的抽象、稀疏表示,但无法捕获检测所需的密集、具体特征。为了解决这些问题,我们提出了 PISA,这是一种新颖的无源 OVOD-TTA 方法,可以无缝集成到开放词汇视觉主干中。我们方法的核心组件是腐败不变特征提取器(CIFE)、特征对齐模块(FAM)和多尺度对齐框架(BAA)。为了捕获适合检测的特征,我们开发了 CIFE,以利用 CLIP 视觉特征在损坏图像中的不变性,确保针对各种损坏的鲁棒性。我们进一步为 预训练 开发 FAM 和 BAA,并进行适应,将腐败不变特征转换为接近原始源域特征的伪单独源域特征。通过这种方式,使用密集且具体的伪单独源域特征而不是不可靠的伪标签信号进行监督。对三个基本模型的损坏的 VOC-C、COCO-C 和 LVIS-C 基准进行的实验表明,PISA 显着提高了原始模型的定位精度和类别识别精度。值得注意的是,PISA 无需访问源域数据即可实现最先进的性能,在 COCO-C 上的 AP@50% 中比现有方法高出 3.92%。