论文

WorldSonus:为交互世界生成实时空间声音

WorldSonus: Bringing Sound to Worlds

应用与实践语音交互与综合语音服务

摘要

世界模型的最新进展使得视觉合成变得越来越真实。然而,这些生成的环境基本上保持沉默。将声音引入世界模型面临三个核心挑战:实时生成以跟上交互式视频流的步伐,交互式控制以响应中流声音指令,以及空间对齐的立体声以反映场景几何形状和摄像机运动。为了满足这些需求,我们引入了 WorldSonus,这是一种交互式视频到音频框架,专为世界模型中的实时空间声音合成而设计。对于实时生成,WorldSonus 采用流式因果自回归扩散架构,以 0.41 的低实时因子 (RTF) 合成音频块。对于交互式控制,我们将以音频为中心的字幕管道与块索引提示调度相结合,从而在生成过程中动态操作声音事件。对于空间对齐,我们利用从不同的立体声和环绕声数据中策划的高质量立体声监督。大量实验表明,在针对世界模型量身定制的同时,WorldSonus 可以有效地推广到开放域视频到音频基准,在声学质量和空间对齐方面匹配或超越最先进的双向模型。项目页面:https://noizai.github.io/WorldSonus/

WorldSonus:为交互世界生成实时空间声音:论文原图
图 1:WorldSonus 概述。 (a) 因果流管道:视频帧映射到两个时间尺度的视觉 token,调节 AR Transformer和整流流头。 (b) 仅训练的 ShiftNCE:仅训练冻结的 Synchformer 教师模型 通过对比窗口匹配引导时间对齐。 (c) 空间立体声监控:野外立体声过滤和全景 FOA 视图解码提供定向音频接地。 (d) 交互式提示控制:文本提示在块边界动态更新,保留会话状态和声音连续性。