论文

KoNeoBench:大语言模型理解韩语新词的精选评估数据集

KoNeoBench: A Curated Evaluation Dataset for LLM Understanding of Korean Neologisms

模型评测基准与评测资源

摘要

尽管自然语言通过新出现的单词和含义不断发展,但大型语言模型 (LLM) 通常是在静态基准上进行评估的。现有的韩语基准以既定词汇为中心,因此对最近的词汇变化的覆盖范围有限,而且它们以英语为导向的设计使得评估韩语的类型学特性变得困难,在韩语中,实词与功能语素有效地结合在一起。在本文中,我们介绍了KoNeoBench,这是一个评估大语言模型对韩语新词理解程度的基准。 KoNeoBench 建立在自 2020 年以来在线新闻中得到证实的 1,785 个韩国新词的基础上,并通过专家词典审查进行整理。每个条目都提供了用法示例、构词分析和字典式定义。基于此资源,我们定义了四项任务并报告最新模型的结果以及人类基线。我们的实验表明,当前的大语言模型在恢复源组件、区分语义类别和生成准确的定义方面表现出明显的局限性。这些结果揭示了最近韩语词汇变化的具体方面,这对当前的大语言模型来说仍然具有挑战性。 KoNeoBench 位于 https://github.com/bcmilab/ko-neobench/ 。