论文

UNISON:通过 Deep LLM Fusion 的统一声音生成和编辑框架

UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

模型架构混合架构

摘要

我们提出了 UNISON,一个潜在的扩散框架,它将语音生成、声音生成和音频编辑统一在一个模型中。单个模型可以处理文本到音频、文本到语音、零镜头说话人克隆、混合语音和声音生成、场景级音频编辑、场景中语音编辑和定时时间合成,所有这些都共享一组权重。我们的架构具有两个核心设计:(1)逐层深度 LLM 融合,通过学习投影将冻结 MLLM 的均匀采样层的隐藏状态注入到相应的 MM-DiT 块中,提供深度匹配的语义条件,从而改进单层基线上的指令跟踪; (2) 统一的多任务架构,其中任务标识仅通过通道掩码进行编码,源音频通过 VAE 编码的通道级联提供。通过具有任务同质批处理和两阶段课程的在线 GPU 端多任务数据合成管道来稳定训练。凭借 621M--732M 可训练参数,UNISON 在评估领域取得了与任务专家模型相媲美或超过的结果,同时比同类统一系统小约 4 倍。