论文
DynFOA:通过条件扩散为动态和声学复杂的 360 度视频生成一阶 Ambisonics
DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos
摘要
空间音频对于沉浸式 360 度视频体验至关重要,但由于在录制过程中难以捕捉空间音频,大多数 360 度视频都缺乏空间音频。因此,从视频自动生成空间音频,例如一阶立体混响 (FOA),仍然是一个重要但具有挑战性的问题。在复杂场景中,声音感知不仅取决于声源位置,还取决于场景几何形状、材质以及与环境的动态交互。然而,现有方法仅依赖于视觉线索,无法对动态源和声学效果(例如遮挡、反射和混响)进行建模。为了应对这些挑战,我们提出了 DynFOA,这是一种生成框架,通过将动态场景重建与条件扩散建模相结合,从 360 度视频中合成 FOA。 DynFOA 分析输入视频以检测和定位动态声源、估计深度和语义,并使用 3D 高斯泼溅 (3DGS) 重建场景几何形状和材质。重建的场景表示提供了物理基础的特征,可以捕获声源、环境和听众视点之间的声学相互作用。根据这些特征,扩散模型生成与场景动态和声学背景一致的空间音频。我们引入了 M2G-360,这是一个包含 600 个真实世界剪辑的数据集,分为 MoveSource、多源和几何子集,用于评估不同条件下的稳健性。实验表明,DynFOA 在空间精度、声学保真度、分布匹配和感知沉浸式体验方面始终优于现有方法。