论文
一级多任务指令引导 3D 空间音频编辑
One-Stage Multi-Task Instruction-Guided 3D Spatial Audio Editing
摘要
空间音频编辑根据用户的指令修改现有声场,同时保留场景的其余部分。与传统的音频编辑不同,它必须对一阶高保真度立体声响 (FOA) 波形中的音频事件、空间信息、动态变化和环境信息进行联合推理。现有的语言引导编辑器主要针对传统音频或依赖顺序操作,因此不直接支持复杂3D空间指令的一级编辑。我们推出了 SwanWeave,这是第一个用于指令引导的 3D FOA 空间音频编辑的单阶段多任务框架。我们使用可控房间模拟从开源语音和音效语料库构建配对 FOA 监督,涵盖四个编辑轴上的十多个单操作和复合任务。为了处理这种异构编辑空间,SwanWeave 使用具有双层路由的空间编辑混合专家 (SE-MoE),为复合指令选择任务感知专家组合,并为本地编辑决策选择帧级路由/空专家。我们进一步引入空间偏好优化(SPO),一种基于直接偏好优化(DPO)的对齐目标,具有特定于编辑的负面目标,并采用分阶段训练来改善自然语言基础。实验表明,SwanWeave 在所有任务中都比现有的通用音频编辑器和空间音频基线实现了更好的编辑质量。空间音频编辑演示可以在 https://swanaigc.github.io/#swanweave 找到,代码可以在:https://github.com/MM-Speech/SwanWeave 找到。