论文

TLDR:压缩音频词元以实现高效的自回归文本转语音

TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

模型推理推理加速

摘要

基于编解码器的自回归 (AR) 语音语言模型通过将语音建模为具有大型预训练骨干的离散音频标记序列,实现了强大的文本转语音 (TTS) 质量。然而,这种 词元级 公式产生了结构效率瓶颈:语音词元序列比文本序列长得多,要求 AR 主干在每个词元位置执行因果计算,并维护一个随着序列长度而增长的 KV 缓存。我们引入了 TLDR,这是一种基于补丁的自回归框架,它通过将因果建模从 词元级 语音序列转变为补丁级序列来加速基于编解码器的 AR-TTS。 TLDR 使用轻量级压缩器将连续的编解码器词元分组为紧凑的潜在补丁,使用 LoRA 调整的冻结预训练 AR-TTS 主干对生成的较短补丁序列进行建模,并使用说话人条件提取器在每个补丁中重建细粒度的语音词元。在补丁大小为 4 的情况下,TLDR 的推理速度比基准 AR-TTS 模型提高了 1.8 倍,并将全局 KV 缓存内存减少了高达 75%。实验结果表明,补丁级全局因果建模可以成为降低基于预训练编解码器的 AR-TTS 系统推理成本的实用方法,而无需更换现有模块。