论文

在潜在空间中使用 MeanFlow 一步生成词元到波形

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

模型推理推理加速

摘要

神经音频编解码器是现代基于 LLM 的文本转语音 (TTS) 和多模态系统的核心。随着低比特率语义编解码器的重要性,词元到波形(Token2Wav)解码器成为决定感知质量和系统效率的瓶颈。传统的多步流匹配解码器可提供卓越的质量,但由于迭代采样而导致推理延迟较高,从而造成严重的质量与速度权衡。在本文中,我们提出了一种新颖的 Token2Wav 架构,通过在高度压缩的潜在空间中应用 MeanFlow 来克服这一限制。通过对平均速度而不是瞬时速度场进行建模,MeanFlow 实现了真正的一步生成。在潜在域中运行可以缓解波形级流的内存和稳定性问题,与多步基线相比,实时因子 (RTF) 提高高达 17$\times$,且质量下降可以忽略不计。此外,我们引入了减轻潜在不匹配的细化策略,包括仅解码器 微调 与冻结 MeanFlow 生成器和端到端联合 微调,在不增加推理时间成本的情况下提高保真度。代码和演示是公开的。