论文
用户生成文本的音位化:基准、分类法和组合方法
Phonemizing User-Generated Text: A Benchmark, Taxonomy, and Compositional Approach
摘要
文本转语音系统越来越多地处理用户生成的文本 (UGT),例如 ppl 和 imo,其发音必须从规范而不是表面形式推断。我们引入了 UGTPhon,这是英语、越南语和韩语 UGT 的第一个字素到音素 (G2P) 基准,以及用于细粒度诊断的基于推理的分类法。现有的 G2P 模型和前沿大语言模型表现出系统性的规范与非规范性能差距,高达 66.8 PER 点。作为基准基线,我们提出了一种简单的组合 G2P 方法,该方法通过精确匹配查找和分阶段解码合并规范形式的证据。在匹配的 ByT5 和 Qwen2.5-0.5B 主干上,显式规范形式建模始终减少非规范 G2P 错误。 0.5B 变体的性能还可以与更大的少样本前沿 LLM 相媲美,突出了为 UGT 音素化显式建模规范形式推理的好处。