论文
LAD-COD:用于伪装物体检测的语言对齐密集感知
LAD-COD: Language-Aligned Dense Perception for Camouflaged Object Detection
摘要
伪装对象检测 (COD) 旨在分割与周围环境表现出高度视觉相似性的对象,从而降低前景-背景可辨别性并削弱外观、纹理和结构的边界证据。这些限制促使使用指令条件语义作为自上而下的指导来识别哪些弱视觉线索与目标相关。最近基于大型多模态模型(LMM)构建的分割系统通过指导掩模解码的指令条件目标嵌入证明了这种可能性。然而,在这种语言到掩模范式中,生成的目标嵌入条件主要是掩模解码器,留下了必须在没有明确指导的情况下保留低对比度边界和精细局部结构的密集视觉特征。我们提出了 COD 的语言对齐密集感知(LAD-COD),这是一个将自上而下的语义目标指导与自下而上的分层视觉特征相结合的框架。 LAD-COD 没有完全采用大型通用图像编码器,而是学习可训练的分层视觉分支,捕获迷彩敏感的纹理、边界和上下文信息。为了使这些特征与目标嵌入保持一致,LAD-COD 应用了语言对齐双视觉融合 (LADVF),它将嵌入扩展到稀疏提示之外,以查询补丁级语言对齐特征,并控制它们与分层特征的剩余集成。这种设计允许语义信息指导定位,同时保留伪装分割所需的精细结构细节。 CAMO、COD10K 和 NC4K 上的实验表明,LAD-COD 在所有 12 个数据集指标比较中获得了最佳报告值。