论文
流程匹配文本到语音教师的分阶段深度修剪 蒸馏:紧凑型印地语语音合成器
Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer
摘要
我们提出了一种实用方法,通过在严格的数据预算(约 17.6 小时)下提取大型流程匹配教师(IndicF5,337M 参数 DiT)来构建紧凑的印地语文本到语音 (TTS) 模型。用这么多数据从头开始训练一个小模型彻底失败了。相反,我们仅通过修剪深度来从教师处热启动学生:保持教师的宽度、文本尺寸、注意力头和梅尔/文本 I/O 固定,以便所有非块张量一对一复制,并保留 Transformer 块的均匀间隔子集。我们首先测量教师容忍的深度(它在 -27% 块时保持接近功能,但超过 -50% 时崩溃),然后逐渐下降(22 -> 16 -> 12 -> 8 -> 6 块),每次修剪后重新 微调,每一步都通过客观的 ASR 字错误率 (WER) 检查来控制。由此产生的学生在 249M 和 190M 参数的未见过句子上达到了 0.00 的 WER,并且在 131M 参数下仍然保持稳健;在 102M 时,我们观察到明显的容量悬崖,我们将其归因于数据预算而不是配方。我们还记录了两个训练/推理功能和库奇偶校验失败(梅尔滤波器组和旋转嵌入库版本),它们会默默地降低音频质量,以及一个与版本无关的修复。该方法可生成在 6 GB 笔记本电脑 GPU 上实时运行的高质量印地语语音。独立的 50 句 FLEURS 基准将发布的 1.9 亿学生与其教师和 MMS-TTS-hin 进行比较。