论文

当名字不再是名字时:资源匮乏中文化纠缠的孟加拉同形异义词的基准数据集和提炼推理 LLM

When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs

模型评测基准与评测资源

摘要

许多孟加拉语单词既是个人名,又是具有文化内涵的普通名词,“玛雅”既是女孩的名字,也是深情同情的意思。选择正确的阅读需要文化知识,而这在现代语言模型的预训练数据中是稀缺的。我们引入了文化纠缠同形异义词 (CEH) 消歧,并建立了由 1,516 个经过专家验证的句子(3,032 个标记出现)组成的孟加拉语基准,其中一个单词出现两次,有两种不同的读法,每个读法都标有基于文化的类别及其背后推理的解释。在开源和闭源模型中,我们发现了一种系统性的主导意义偏差:模型默认使用普通名词的含义而忽略了名称。孟加拉语特定模型在我们测试的每一个提示机制下都失败了,这表明仅针对特定语言的预训练并不能赋予文化基础。我们进一步表明,对比性思维链提示可以在无需训练的情况下大幅减少这种偏差,并且提炼文化解释可以教会小型(1-3B)模型推理正确的阅读而不是记住标签,将主导含义偏差从高达 100% 削减到 5% 以下,并将失败的孟加拉特定模型转变为我们最强大的系统。数据集和代码可在 https://github.com/ashuvo25/BanglaCEH 获取。