论文
WorldSonus:为交互世界生成实时空间声音
WorldSonus: Bringing Sound to Worlds
摘要
世界模型的最新进展使得视觉合成变得越来越真实。然而,这些生成的环境基本上保持沉默。将声音引入世界模型面临三个核心挑战:实时生成以跟上交互式视频流的步伐,交互式控制以响应中流声音指令,以及空间对齐的立体声以反映场景几何形状和摄像机运动。为了满足这些需求,我们引入了 WorldSonus,这是一种交互式视频到音频框架,专为世界模型中的实时空间声音合成而设计。对于实时生成,WorldSonus 采用流式因果自回归扩散架构,以 0.41 的低实时因子 (RTF) 合成音频块。对于交互式控制,我们将以音频为中心的字幕管道与块索引提示调度相结合,从而在生成过程中动态操作声音事件。对于空间对齐,我们利用从不同的立体声和环绕声数据中策划的高质量立体声监督。大量实验表明,在针对世界模型量身定制的同时,WorldSonus 可以有效地推广到开放域视频到音频基准,在声学质量和空间对齐方面匹配或超越最先进的双向模型。项目页面:https://noizai.github.io/WorldSonus/
