Praxy Voice:语音提示恢复 + BUPS,用于从冻结的非印度语基地进行商业级印度语 TTS,商业训练数据成本为零
Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost
摘要
商业 TTS 系统产生近乎原生的印度语音频,但最好的开源库(Chatterbox、Indic Parler-TTS、IndicF5)在测量的语音维度上落后于它们,而最广泛采用的多语言库(Chatterbox,23 种语言)甚至没有标记泰卢固语或泰米尔语。我们问:在不训练新的声学解码器和任何商业 TTS 训练数据的情况下,将这种非印度语母语基础带入泰卢固语、泰米尔语和印地语的商业级输出的最小干预是什么?我们结合了三个部分:(1)BUPS,一个婆罗米语统一音素空间,它确定地将七个印度文字罗马化为 ISO-15919,以便 Chatterbox 的拉丁语分词器可以处理它们; (2) 仅针对文本标记预测器(Chatterbox 的 t3)的 LoRA 适配器,使用印地语代理 language_id 在约 1,220 小时的许可印度语音频上进行训练; (3) 语音提示恢复配方——一个 8-11 秒的同语言参考剪辑加上三个采样覆盖(夸张 0.7,温度 0.6,min_p 0.1;“配置 B”)——无需声学解码器训练即可恢复商业级声学输出。在印地语中,LoRA 会降低准确性,我们改为使用普通 Chatterbox + Config B,提供两个分支部署。使用配套的 PSP 基准对 10 个语音试点集进行评估,Praxy Voice 匹配或略微领先商业基线:泰卢固语上的卷舌折叠为 26.7%(相对于 Sarvam Bulbul 的 33.3%)、泰米尔语折叠为 71%(相对于商业三人组的 86%)、印地语上的 0.025 LLM-WER(与 Cartesia 并列)索尼克-3)。对于句子内代码混合,我们添加了第三个分支(IndicF5 + 本机脚本音译),将 Hi/Te/Ta 中的代码混合 LLM-WER 从 0.80-0.85 下降到 0.14-0.27。我们发布了 R6 LoRA 权重 (Apache-2.0)、推理代码和路由器 (MIT) 以及 Gradio 演示。