论文
Vagdhenu:梵语 Vrutta(米)感知 Shloka-to-Chant (TTS) 系统
Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit
摘要
我们推出了 Vagdhenu,一种梵语 vrutta(米)感知 shloka 到吟唱系统:一种文本到语音系统,可将格律诗句以高保真度映射到其吟唱的 parayana 背诵。这是一个经验报告,而不是一个新的架构。我们采用现成的流匹配 TTS 主干和大规模神经声码器,并添加忠实的梵文圣歌管道所需的组件:一个通过卡纳达语正字法路由梵文的前端,以避免梵文在印度模型中触发的印地语风格的 schwa 删除;遵循微妙的梵语音系的前端(visarga sandhi 及其 jihvamuliya 和 upadhmaniya 同位素、alpaprana 和 mahaprana 的送气对比,以及齿音、卷舌音和腭音保持不同);以及一个 vrutta 感知机制,可以检测仪表并根据半参考规则选择完全匹配的参考。我们报告了一个塑造系统的负面结果:在自填充流匹配主干中,文本侧韵律调节器在架构上是惰性的,因为模型从上下文梅尔中恢复音调并且嵌入没有梯度;参考剪辑和语音控制重新训练是唯一有效的韵律杠杆。我们还报告了四个家族(StyleTTS2、VITS2、Matcha-TTS 和流程匹配主干)的比较谱系,其中每个早期家族在连词或韵律上都达到了上限,而专家 MOS 接近 4.6 时,五个小时的克隆就清除了这一上限。该系统交付了两个部署:一个 32 章、5183 节经文的视频语料库(约 17.5 小时)和一个涵盖 12 本书约 18000 节经文的音频应用程序。我们发布了前端、推理和训练代码、权重、单说话者圣歌数据集和交互式演示。