论文
CNeo-Bench:根据中文新词诊断 大语言模型
CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms
摘要
中文新词利用了多样化且独特的语言机制,例如语音替换(例如,886 表示“再见”)和视觉字符分解,这在其他语言中是罕见的。我们引入了 CNeo-Bench,它是 4,759 个带有参考定义的此类新词的基准,根据每个表达背后的语言机制分为 5 个顶级类别和 9 个子类别。 CNeo-Bench 配备了一个两层评估框架,该框架将模型是否可以描述新词与其是否可以对其底层机制进行操作分开。评估 18 LLM,我们发现中文新词仍然是一个公开的挑战;大多数模型在定义生成方面都低于 40%,并且在几个子类别上出现了系统性的识别操作差距:模型正确地描述了新词,但在源形式恢复任务中,用语义等价物(释义)代替源形式,而不是生成源形式本身。对 1,058 个困难项目的几次分析表明,上下文中的示例可以解决许多困难的情况,但仍会留下明显的错误部分,这表明仅靠提示可以解决的挑战。