论文

WAND:用于高效自回归文本转语音模型的窗口注意力和 知识蒸馏

WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models

模型优化模型压缩

摘要

最近的仅解码器自回归文本转语音 (AR-TTS) 模型可产生高保真语音,但由于完全自注意力,它们的内存和计算成本随序列长度呈二次方扩展。在本文中,我们提出了 WAND、Windowed Attention 和 知识蒸馏,这是一种框架,可调整预训练的 AR-TTS 模型以恒定的计算和内存复杂度进行操作。 WAND 将注意力机制分为两种:对条件词元的持续全局注意力和对生成词元的局部滑动窗口注意力。为了稳定 微调,我们采用了逐渐收紧注意力窗口的课程学习策略。我们进一步利用全注意力老师的知识蒸馏来恢复高保真合成质量和高数据效率。在三个现代 AR-TTS 模型上进行评估后,WAND 保留了原始质量,同时实现了高达 66.2% 的 KV 缓存减少以及长度不变、近乎恒定的每步延迟。