论文

YOMI-Bench:评估日语 LLM 的汉字阅读和语音理解的基准

YOMI-Bench: A Benchmark for Evaluating Kanji Reading and Phonological Understanding of LLMs for Japanese

模型评测基准与评测资源

摘要

我们提出了 YOMI-Bench,这是一个评估日语 大语言模型 (LLM) 的汉字阅读和语音理解的基准。在日语中,单个汉字字符通常有多种可能的读法,因此很难仅从表面文本推断出正确的读法。由于这些语言特征,根据经验可知,LLM 在日语汉字阅读中表现出较低的性能。拟议的 YOMI-Bench 包含四个任务,专门用于评估日语汉字阅读性能。在使用 YOMI-Bench 的评估中,我们评估了 1 个多语言开放 LLM、4 个日语专用开放 LLM 和 5 个商业 LLM。结果,我们发现即使是日语专用模型也表现出较低的性能,并且商业模型在需要考虑汉字阅读的生成任务上也表现不佳。