论文

构建和评估用于电信客户服务的合成孟加拉语语音资源

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

模型训练合成数据

摘要

面向客户的应用程序中使用的语音系统通常需要覆盖特定领域的语言。我们为电信客户服务场景提供了一个合成孟加拉语语音数据集。该数据集包含 10,000 个音频文本对、大约 26.82 小时的 24 kHz 语音,以及 9,000、500 和 500 个示例的预定义训练、验证和测试分割。它在 CC-BY-4.0 许可下在 Hugging Face 上公开发布。该语音是通过 OmniVoice 在语音克隆模式下使用真实女性参考录音和文字记录生成的,具有 bfloat16 精度、16 个扩散采样步骤和 1.0 的语速控制值。除了原始孟加拉语文本之外,该数据集还提供了专为 ASR/STT 训练和评估而设计的标准化转录字段。我们报告使用从 bengaliAI/tugstugi_bengaliai-regional-asr_whisper-medium 微调的域适应 Whisper ASR 模型对所有 10,000 个样本进行自动清晰度检查,并对选定样本进行手动听力检查。评估给出的平均 WER 为 2.54%,平均 CER 为 0.59%,WER 和 CER 中位数为 0.00%。这些结果表明在选定的自动评估管道下具有很强的文本音频一致性,同时本文还讨论了合成语音和基于 STT 的评估的局限性。