论文

Balalaika-Longform:用于连续长格式文本转语音的俄语语音语料库

Balalaika-Longform: A Russian Speech Corpus for Continuous Long-Form Text-to-Speech

模型训练监督微调与指令调优

摘要

长文本到语音的转换必须在较长的世代中保留所要求的单词,但句子级的训练和评估可能会隐藏遗漏和早期停止。我们引入了 Balalaika-Longform,这是一个开放的俄语语料库,时长为 189 小时,连续单位为 30 秒到 15 分钟。长单元和匹配的短窗口支持对相同源录音进行微调比较,并且随附的评估保留了每次合成尝试。我们在任一视图上对 CosyVoice3、Qwen3-TTS、VoxCPM2 和 F5-TTS 进行微调,并在 50 个文本语音对上测试连续合成,其中微调中未见语音,约为 75、300 和 1,200 个单词。在 1,200 个单词时,CosyVoice3 WER 从短窗口微调后的 99.9% 下降到长目标的 47.3%,以及带标点、格式匹配的转录本的 16.6%;配对间隔有利于 Qwen3-TTS 和 VoxCPM2 的长目标,而 F5-TTS 则有小幅优势,其绝对 WER 保持在 90% 以上。结果隔离了固定连续生成协议下训练序列长度的影响。