论文

评估日本大语言模型对输入法相关错误和印刷错误的鲁棒性

Evaluating the Robustness of Japanese LLMs to IME-Related and Typographical Errors

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 在各种自然语言处理任务中都取得了出色的性能。然而,它们对印刷错误的鲁棒性仍未得到充分研究,特别是在日语中,文本输入涉及多种书写系统和基于 IME 的转换。在这项研究中,我们评估了日本大语言模型针对实际日语特定拼写错误的鲁棒性。我们介绍五种错别字类别:字符换位、字符替换、同音字转换、日语输入法转换和全角转换。这些扰动应用于三个日语基准数据集(JMMLU、JCommonsenseQA 和 JamC-QA),并对 11 个日语和多语言大语言模型进行了评估。结果表明,字符换位和字符替换拼写错误始终会降低基准中的准确性,而 IME 转换、全角转换和同音字转换的影响相对有限。这些发现表明,当前的日语大语言模型仍然容易受到实际日语打字错误的影响,特别是那些严重扭曲原始输入的错误,这凸显了实际输入环境中鲁棒性评估的重要性。