论文

通过自回归扩散实现流同步空间音频生成 Transformer

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

模型架构混合架构

摘要

实时准确的空间音频生成对于提供沉浸式体验至关重要。然而,现有的空间音频合成技术通常受到生成质量和高推理延迟之间的权衡的阻碍,并且难以从多模态输入中捕获精确的空间信息。为了应对这些挑战,我们提出了 SwanSphere,这是一个统一的流媒体框架,用于从全景视频和文本提示生成高保真空间音频。 SwanSphere 主要做出以下贡献: 1)我们引入了因果自回归扩散 Transformer 架构,可以实现流式高质量空间音频生成。 2)我们设计了一种空间视频音频对比(SVAC)学习策略,将视频编码器与声学领域结合起来,并进一步采用多目标在线直接偏好优化(ODPO)方案,从而产生强大的空间感知和鲁棒的多模态空间音频合成。 3)为了缓解当前空间音频数据集的稀缺性,我们还开发了一个自动注释管道来生成详细的空间描述文本。实验结果表明,SwanSphere 在视频到空间和文本到空间的音频生成任务中均取得了优异的性能。演示可以在:https://swanaigc.github.io 找到。