论文

DeCo-DETR:用于高效开放词汇目标检测的解耦认知 DETR

DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection

应用与实践视觉感知与空间理解

摘要

开放词汇对象检测(OVOD)使模型能够识别预定义类别之外的对象,但现有方法在实际部署中仍然受到限制。一方面,多模态设计由于在推理时依赖文本编码器,通常会产生大量的计算开销。另一方面,紧密耦合的训练目标引入了封闭集检测精度和开放世界泛化之间的权衡。因此,我们提出了解耦认知 DETR(DeCo-DETR),这是一个以视觉为中心的框架,通过统一的解耦范例来应对这些挑战。 DeCo-DETR 不依赖在线文本编码,而是根据预先训练的 LVLM 生成并通过 CLIP 对齐的区域级描述构建分层语义原型空间,从而实现高效且可重用的语义表示。在此表示的基础上,该框架通过解耦训练策略进一步将语义推理与本地化分离,该策略将对齐和检测分离为并行优化流。对标准 OVOD 基准的大量实验表明,DeCo-DETR 实现了有竞争力的零样本检测性能,同时显着提高了推理效率。这些结果凸显了将语义认知与检测分离的有效性,为可扩展的 OVOD 系统提供了实用的方向。