论文

解锁大型视听检索模型中的空间基础

Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

应用与实践视觉感知与空间理解

摘要

弱监督为视听声源定位设定了一个实用的机制,因为大规模获得密集的空间注释的成本很高。然而,这项任务仍然具有挑战性,因为模型必须在没有像素级监督的情况下从时间对齐的视听数据中定位声源。最近的大规模视听检索模型以前所未有的规模进行训练,编码丰富的多模态结构。我们展示了它们的潜在表示,尽管针对全局对齐进行了优化,但仍然可以实现细粒度的空间基础。虽然由于全局池化,空间细节在检索主干的上层中逐渐丢失,但中间视觉标记保留了高度结构化的空间信息。为了利用这一点,我们引入了 LAIP(\emph{通过音频通知池进行本地化}),这是一个采用轻量级 \emph{音频通知空间池}(AiSP)来取代标准全局聚合模块的框架。通过查询在帧级别对齐的音频的中间视觉标记,LAIP 恢复了否则会被检索管道丢弃的局部空间信息,其中针对 PE-AV(具有底层时间聚合的堆栈)观察到的最大增益。我们的方法在 AVSBench 和 AVATAR 上实现了最先进的性能,几乎是后者之前结果的两倍,将平均 CIoU 从 13.21 提高到 26.22。