论文

MiDashengLM-Gen:通过LLM驱动的自回归流匹配统一生成音频场景

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

模型架构混合架构

摘要

生成同时融合语音、音乐和声音效果的连贯音频场景仍然是一项重大挑战。当前的方法通常依赖于脱节的管道,其中冻结的、解耦的文本编码器为单独的音频解码器提供数据,限制了跨模式优化并导致语音清晰度较差。为了克服这些限制,我们引入了 MiDashengLM-Gen,这是一个端到端框架,它将预训练的 大语言模型 (LLM) 与每个词元条件流匹配相结合,用于自回归、可变长度混合音频场景生成。 MiDashengLM-Gen 代表了第一种使用端到端训练模型进行通用文本到音频生成的方法。实证评估表明,MiDashengLM-Gen 比现有统一模型显着提高了语音清晰度。在 Seed-TTS 基准测试中,英语单词错误率 (WER) 从 12.15% 下降至 2.79%,接近专用文本转语音 (TTS) 系统的性能 (1​​.24%)。此外,该框架有效地扩展到多语言环境,与现有基线相比,产生了极具竞争力的多语言 WER。最后,该模型在 MECAT 基准上保持有竞争力的混合音频生成质量。代码和检查点可在 https://github.com/xiaomi-research/midashenglm-gen 和 https://huggingface.co/mispeech/midashenglm-gen 获取,演示页面可在 https://xingws.github.io/midashenglm-gen-demo/ 获取。