论文
Yo-ByT5:高效、高保真约鲁巴语变音符号恢复
Yo-ByT5: Efficient and High-Fidelity Diacritic Restoration for Yorùbá
摘要
约鲁巴语是一种广泛使用的声调语言,依靠变音符号来避免词汇歧义。然而,它通常是在没有这些变音符号的情况下编写的,从而阻碍了下游自然语言处理(NLP)任务。在本文中,我们介绍了 Yo-ByT5,这是一种在 ByT5-small 基础上进行微调的字节级自动变音符号恢复 (ADR) 模型。我们根据一致的协议在 YAD 基准上评估 Yo-ByT5 以及五个公开发布的 Yorùbá ADR 模型和一个开放权重大语言模型 (LLM)。我们的结果表明,Yo-ByT5 的性能与最强的现有模型 mT5-base 的性能相匹配,DER 为 10.14%,CER 为 3.48%。此外,尽管使用了 mT5-base 大约一半的参数数量,但它仍表现出卓越的文本保真度。我们还发布了训练代码和模型输出,并呼吁开发一个更大的、专门为约鲁巴语变音符号恢复而构建的基准。