论文
深度递归:用于流程匹配 TTS 的循环Transformer
Depth through recurrence: Looped transformers for flow-matching TTS
摘要
我们研究如何通过流匹配文本到语音的重复来组织 Transformer 深度,改变权重重用的数量、顺序和位置。在共同的训练目标和采样器下,每个网络评估有 7 个布局执行 18 个块调用。在 Seed-TTS 和 LibriSpeech-PC 上,SEQUENCE 连续两次应用 9 个块中的每一个,在 32 个采样步骤中保留有竞争力的清晰度、说话者相似性和预测语音质量,参数比非共享基线少 47.1%。循环 6 个块 3 次进一步减小了模型大小,但相对于循环 9 个块 2 次,增加了 32 步单词错误率。在匹配的参数数量和执行深度下,重用顺序和共享位置会产生不同的质量权衡。这些比较取决于采样预算:前缀和后缀具有相似的 32 步单词错误率,但后缀在两个数据集上的 4 步中分别差了 3.44 和 5.97 个百分点。在两个数据集上,只有 Middle 在平均单词错误率上排名第一或第二,分别为 32 和 4 个步骤。这些结果表明,循环计算的组织会影响综合质量,并且应根据采样预算和感兴趣的质量维度选择重用布局。