论文
LLM 知道卢森堡借用什么吗?探索低资源多语言模型中的词汇新学
Do LLMs Know What Luxembourgish Borrows? Probing Lexical Neology in Low-Resource Multilingual Models
摘要
大语言模型 (LLM) 越来越多地用于小型接触语言的写作辅助,但尚不清楚它们是否尊重词汇借用和新词的社区规范。我们引入 LexNeo-Bench,这是一个 3{,}050 实例 词元级 基准测试,源自 LuxBorrow(一个大型卢森堡新闻语料库),其中目标标记被标记为本地或法语、德语或英语借词。使用此基准,我们在两项任务上跨 34 个提示设置探测了三个多语言 LLM:借用类型分类和二元词汇创新代理(借用与本机)。在没有外部上下文的情况下,模型在借用分类方面的表现仅略高于机会,因此我们构建了一个语言知识图,该知识图对捐赠者语言、形态模式和词汇类似物进行编码,并将特定于实例的子图注入到提示中。知识图提示将借用分类准确率从 25 - 35% 提高到 71 - 81%,并在很大程度上缩小了小型模型和大型模型之间的差距,同时使新学检测变得困难且对少样本设计敏感。我们的结果表明,词汇感知提示对于资源匮乏的接触语言中的稳健借用判断非常有益,并且词汇资源可以作为 LLM 评估的结构化上下文。这项研究是在 ENEOLI COST Action 范围内进行的,研究了多语言卢森堡数据中借用作为词汇创新的一种形式。