论文

A2DINOv3:通过社交协作重新思考多模式对象检测

A2DINOv3: Rethinking Multi-Modal Object Detection via Socialized Collaboration

应用与实践视觉感知与空间理解

摘要

多模态物体检测对于在具有挑战性的条件(包括弱光和不利环境)下进行可靠的场景理解至关重要。最近的视觉基础模型(例如 DINOv3)表现出了强大的表示能力,但使其适应多模态场景仍然具有挑战性。现有的密集跨模态融合策略通常迫使异构模态不加区别地交互,这可能会引入冗余信息并破坏有价值的预训练表示。为了解决这个问题,我们从社会化学习的角度重新审视多模态融合,并提出了 DINOv3 (A2DINOv3) 的适配器,这是一个具有社会化协作协议 (SCP) 的多专家协作框架。具体来说,RGB 和红外分支被建模为异构专家,它们独立保留其专业知识,同时通过选择性和受限交互交换互补信息。这种设计减轻了有害的跨模式干扰,并防止在适应过程中预训练先验的退化。此外,引入零初始化策略来逐渐激活跨模态协作,从而实现从特定模态学习到协作表示学习的平滑过渡。在空中检测 (GAIC)、自动驾驶 (FLIR)、微光监视 (LLVIP) 和多种现实场景 (M3FD) 等四个多模态基准上进行的大量实验表明,A2DINOv3 在多模态目标检测方面始终保持最先进的性能。