论文
这里是立体声世界:学习动态空间对应以生成沉浸式联合视频音频
Here the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation
摘要
最近的联合视频-音频生成模型已经实现了强语义对应和时间同步。然而,AR/VR 和互动游戏等应用进一步需要立体声音频来提供身临其境的感觉,而这一点在很大程度上仍然被忽视。有效的立体声音频需要感知的声音位置与其相应视觉源的运动一致地演变。我们将此属性称为动态空间对应,并提出了 StereoBind,这是一个将视觉源运动与立体声生成绑定的框架。 StereoBind 使用运动轨道通过三种互补机制来协调视觉运动和立体声音频。视觉运动绑定建立源感知视听对应,空间跟踪编码器捕获绝对源位置,剩余跟踪 RoPE 模拟相对运动。为了监督和评估,我们构建了 StereoWorld-29K,这是一个具有配对运动轨迹的大型立体声音频视频数据集,以及用于测量视听空间一致性的 StereoWorldBench。实验表明,与现有模型相比,StereoBind 显着改善了立体声音频生成的空间对齐,同时保持了整体视听质量。