论文

AuK 技术报告:语音生成和编辑的开源基础模型

AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing

模型架构Transformer

摘要

我们介绍 AuK,这是一种开源基础模型,它通过自然语言指令和音频上下文的通用接口统一语音生成和编辑。为了支持这一广泛的功能集,我们构建了大约 30.3 亿个指令音频实例和 195 万小时的有效监督,涉及五个任务系列:语音生成、内容编辑、增强和分离、副语言编辑和声学编辑。 AuK 结合了用于语义调节的多模态 大语言模型、用于声学调节的语音、一般音频和音乐联合训练的 VAE,以及执行双流 MMDiT 块和统一的单流 DiT 块进行生成的混合整流流 Transformer。训练从仅生成热身开始,然后进行联合生成 - 编辑 预训练。然后,我们应用补充的 后训练 策略:用于开放式编辑的人类反馈偏好优化和用于语音生成的基于奖励的强化学习。为了降低推理成本,我们通过一致性初始化和任务路由解耦 DMD 进一步提炼模型。由此产生的 AuK-Flash 在没有无分类器指导的情况下执行 4 步推理,并在匹配条件下实现了比完整模型 4.5 的挂钟加速。实验证明了其在零样本和指令控制语音生成以及一般指令引导编辑方面的领先性能,同时在信号级恢复任务上保持竞争力。我们发布了源代码和模型权重,以支持可重复性和进一步研究。