论文
PhysWave:用于可控空间音频生成的物理引导潜在扩散模型
PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation
摘要
文本到空间音频生成,例如文本到一阶高保真度立体声响复制 (FOA),为价值数十亿美元的游戏和电影行业创建空间音频提供了一种便捷的方法。然而,现有的文本到 FOA 方法主要是数据驱动的,可能会产生违反源方向和距离之间的声学关系的音频。它们还将描述性控制和参数性控制分开,迫使用户以可用性换取精度。在本文中,我们提出了 PhysWave,一种物理引导的潜在扩散模型,用于可控文本到 FOA 的生成。 PhysWave 通过共享的路点标题表示形式统一了自然语言和轨迹控制,并通过两个可微分的声学先验增强了扩散训练:球谐方向一致性和平方反比距离一致性。为了支持动态空间生成,我们进一步构建了一个具有不同声音类别和源轨迹的 300K 剪辑 FOA 数据集。大量结果表明,所提出的先验有助于 PhysWave 生成空间一致的 FOA 音频,同时保持有竞争力的音频质量。进一步的分析表明,这些物理先验提高了训练期间的空间一致性,并且还可以用作 无需训练 空间细化的推理时间指导。