论文
听觉世界模型:3D 世界的空间感知声音生成
Audible World Models: Spatially Aware Sound Generation for 3D Worlds
摘要
文本和图像调节的世界生成器可以创建视觉丰富的 3D 环境,但这些世界通常保持沉默或依赖于仅从文本或渲染视频合成的音轨。尽管这样的音频可以传达应该听到的内容,但它缺乏对声源所在位置以及它们感知的声音如何随着听众的移动而变化的明确表示。我们引入了 Audible World Models,这是一个无需训练的框架,它将声音融入到生成的世界状态中。从文本提示开始,我们的系统构建了一个全景 3D 代理,将其分为语义层,识别产生声音的前景对象和环境背景区域,并为每个声音标签合成干音频。然后,它将这些源锚定到重建的几何结构,并使用几何声学传播渲染与听众相关的空间音频。通过显式链接语义、几何和声音传播,该框架可以保持持久的源位置,同时使渲染的音频适应听众视角和运动的变化。 80 个生成场景的实验表明,与文本、视频和全景条件基线相比,空间一致性有了显着提高,同时保持了竞争性语义对齐。基于 VLM 的评估和人类评估进一步表明,我们的音轨因其视听一致性、空间合理性和运动相关行为而受到青睐。