论文

用于流式传输 Token-to Mel 语音解码的 X-Pred MeanFlow

X-Pred MeanFlow for Streaming Token-to-Mel Speech Decoding

模型推理推理加速

摘要

基于离散词元的语音生成的最新进展凸显了在流媒体和对话场景中高效词元到波形合成的重要性。流匹配声学解码器实现了高质量的 token-to-mel 生成,但其迭代采样需要多个神经功能评估,限制了低延迟语音合成。 MeanFlow 通过对时间间隔内的平均速度进行建模来减少采样预算,但在极少步骤的 token-to-mel 生成下保持高音质仍然具有挑战性。为了应对这一挑战,我们提出了 X-Pred MeanFlow,这是一种通过梅尔空间预测重新参数化 MeanFlow 的几步流式 token-to-mel 解码器。解码器预测广义梅尔场并分析导出相应的采样平均速度,从而保留 MeanFlow 公式,同时提供直接的声学预测目标。我们进一步引入了层选择性块式注意力,以实现具有有界上下文的连续块式生成。实验表明,X-Pred MeanFlow 比 Direct-$u$ MeanFlow 改进了几步 token-to-mel 合成,并支持稳定的流生成。提供语音样本。https://renxiaming.github.io/xpred-meanflow-stream-demo