论文

Scene2Sound:3D 高斯世界的听觉声景生成

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

应用与实践内容创作

摘要

3D 高斯溅射 (3DGS) 将捕获或生成的图像转换为逼真的 3D 世界模拟,用户可以自由探索,但这些世界保持沉默。由于现有的音频生成方法以单个图像或视点为条件,因此它们的声音与观察结果相关,并且在听众移动时无法保持一致。我们介绍了通过听觉基础为给定 3DGS 世界生成空间一致的声景的任务,识别世界中的哪些对象应该发出声音并将每个对象锚定到持久的 3D 位置,并提出 Scene2Sound,这是一个基于此基础构建的 无需训练 框架。仅从输入世界来看,我们的管道选择共同覆盖场景的视点,使用视觉语言模型识别发声对象,并通过高斯集匹配将多视图检测关联到 3D 实例,高斯集匹配测量渲染每个检测的高斯集之间的重叠。然后,每个源接收生成的音频,该音频由标准的基于对象的音频引擎在任意收听者姿势下实时空间化。我们进一步提出了两种空间一致性指标,一种测试渲染的音频是否一致地响应听众的运动,另一种测试所声明的源是否受到其位置所保留的视图的支持。在一组精心生成的 3DGS 世界和从现实世界 360 度捕获生成的 3DGS 场景中,Scene2Sound 保留了强大的每视点基线的音频质量,同时保持了每视点和单全景管道无法实现的空间一致性,并且用户研究证实了感知优势。项目页面:https://masaki-lmd.github.io/scene2sound/。