论文
OmniEcho:全模态具体代理的视听空间理解
OmniEcho: Audio-Visual Spatial Understanding for Omni-Modal Embodied Agents
摘要
人类可以毫不费力地定位声源的方向,并将其与视觉线索相结合以进行推理,但这对于实体代理来说仍然具有挑战性。特别是,目前还不清楚如何在具体环境中有效地评估和建模空间音频理解。为了解决这一差距,我们引入了 \textbf{OmniEchoBench},这是一个空间视听感知和视听语言导航的统一基准。 OmniEchoBench 包含 6 个任务,涵盖 197 个真实空间视听场景、2,972 个问答对以及从 30 个真实环境收集的一阶立体混响 (FOA) 音频的 900 个导航样本。为了实现可扩展的训练监督,我们开发了一个用于空间音频的可控渲染管道。它保持声源、视觉观察和代理轨迹之间的几何一致性。在此基础上,我们提出了 \textbf{OmniEcho},一种空间感知的全模态模型。它引入了 FOA 空间编码器以及预训练的语义音频路径。大量实验表明,OmniEcho 在空间视听感知方面实现了最先进的性能。对于我们的声音引导导航,OmniEcho 达到了接近传统视觉语言导航的性能水平。这些结果表明,空间音频可以作为具体场景推理和导航的有价值的信号,同时也强调细粒度空间定位和距离估计是重要的开放挑战。我们的代码和数据将在此 https URL 中提供