论文
SonicWeave:用于统一音频场景生成的块路由专家混合
SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation
摘要
文本调节的通用音频生成正在超越孤立的语音、音乐和音效合成,转向单一模型,将它们组合成可控、连贯的音频场景。这种统一的设置特别具有挑战性:异构组件对共享主干强加了相互冲突的结构要求,而复杂的混合场景可能包含局部不同或重叠的内容,需要在同一剪辑中进行细粒度的适应。现有的音频专家混合 (MoE) 主要在域级别进行路由,而词元式路由则忽略了声学信号固有的局部连续性。我们提出了 SonicWeave,一种用于统一音频场景生成的流匹配模型。其核心是具有冲突门控先验路由机制(CPE-MoE)的块路由MoE。 CPE-MoE 通过将编码结构化文本条件和扩散阶段的全局先验与来自不断演变的声学状态的局部证据相结合来路由连续的声学块。当局部状态不可靠时,学习到的冲突门有利于先验,同时当某个区域偏离全局场景上下文时,允许局部证据影响路由。 SonicWeave 通过一组权重支持语音、音乐、音效、歌唱及其细粒度的混合。在 TTS、TTA 和 TTM 基准中,SonicWeave 持续改进受控 Dense 和 Base-MoE 基准。复杂场景评估进一步证明了构图质量的提高,而路由分析揭示了跨扩散阶段的内容相关的专家专业化。这些结果表明,时间相干的先验证据路由是统一音频生成的有效条件计算策略。项目页面:https://caiyunrui.github.io/SonicWeave。