论文

字素到音素转换的 大语言模型 基准测试:日本案例研究

Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study

模型评测模型能力评测

摘要

字素到音素 (G2P) 转换对于可控且稳健的文本到语音的转换至关重要,而 大语言模型 (LLM) 拥有广泛的语言知识,提供了一种有前途的方法。我们在日语 G2P 上对 30 多个 LLM 进行了基准测试,将它们与传统形态分析器对 3000 个手动注释的句子进行了比较。我们评估了两种提示策略:一种是解析模式,其中 LLM 执行形态分析,然后进行基于规则的假名转换;另一种是直接模式,其中 LLM 直接预测假名读数。结果表明,模型大小、版本和日语专业训练是关键因素,最好的 LLM 的假名字符错误率低于 0.52%,而最好的传统工具 (1.03%)。对于大多数模型来说,解析模式的性能优于直接模式,因为基于规则的后处理减轻了 LLM 处理复杂发音规则的负担。我们还表明,将 LLM 预测的假名输入假名输入 TTS 会比端到端 TTS 产生更好的发音。