论文

SceneBind:跨视觉、音频和语言绑定内容和地点

SceneBind: Binding What and Where Across Vision, Audio and Language

模型训练预训练

摘要

我们提出了 SceneBind,一种现实场景的全模式表示,具有跨视觉、音频和语言的联合语义和 3D 空间理解。现有的全模态编码器擅长实例级语义(即存在的内容),但通常缺乏明确的空间结构(即它在哪里)。 SceneBind 通过将每个场景表示为语义空间实体,将全局语义嵌入与以对象为中心的语义空间槽相结合来解决这一差距。这种表示明确地捕获了对象级语义、空间属性和不确定性。我们进一步提出了 SceneBind Matching,这是一种语义空间匹配方案,它将全局场景相似性与对象对齐相结合,支持跨模式场景检索和物体定位。为了训练和评估 SceneBind,我们策划了一个具有结构化语义和空间注释的新颖的现实世界双耳视听数据集,并提出了一种用于跨模态对齐语义和空间信号的训练协议。 SceneBind 与大规模预训练语义编码器兼容,只需少量额外标记即可添加轻量级空间建模。它实现了最先进的场景和空间检索,同时能够向视听定位等下游任务提供强大的零镜头传输。