论文

当相似意味着不同时:评估阿拉伯语-希伯来语同源词中的 LLM

When Similar Means Different: Evaluating LLMs on Arabic--Hebrew Cognates

模型评测基准与评测资源

摘要

阿拉伯语和希伯来语作为密切相关的闪族语言,有许多具有相似表面形式的单词,包括真同源词、假朋友和现代借词。这些词汇关系给跨语言语义解释带来了歧义,因为相似的形式可能对应于共享的、不同的或借用的含义。为了评估 LLM 是否可以做出这些区分,我们引入了 SemCog Bench,这是一个精心策划的基准,包含 1,858 个阿拉伯语-希伯来语单词对,并带有用于同源识别和语义消歧的句子级注释。我们跨多种输入表示和上下文设置评估了一组多样化的开源和专有 LLM。我们的结果表明,对表面形式相似性的依赖,对假朋友的表现较弱,对外来词的变化很大。我们进一步发现,上下文和规模会产生依赖于模型的增益,而原始脚本输入通常表现最佳。我们的研究结果揭示了跨语言形式意义推理的局限性,并将 SemCog Bench 确立为跨语言词汇语义学的基准。我们的代码和数据是公开的。