论文

使用留一方言交叉验证和可解释的 AI 进行孟加拉地区方言的跨方言 NER

Cross-Dialect NER for Bangla Regional Dialects Using Leave-One-Dialect-Out Cross-Validation and Explainable AI

模型评测鲁棒性、公平性与可信度评测

摘要

孟加拉语是世界第七大语言,表现出显着的地区方言多样性,巴里沙尔语、吉大港语、锡尔赫特语、诺阿卡利语和迈门辛语等方言在词汇、形态和句法特征上各不相同。这些变化给命名实体识别 (NER) 带来了巨大的挑战,限制了标准孟加拉语或单一地区方言训练的模型的泛化。本文提出了一个使用公开可用的 ANCHOLIK-NER 数据集的跨方言孟加拉语 NER 框架,该数据集包含五种主要孟加拉方言的 17,405 个带注释的句子和 101,817 个标记。采用留一方言交叉验证(LODOCV)策略,在四种方言上训练模型并评估剩余的未见过的方言。在相同的实验设置下评估了八种基于 Transformer 的预训练模型,包括 BanglaBERT、MuRIL、XLM-RoBERTa 和 Multilingual-E5。 Multilingual-E5 Large 在各个方面都获得了最高的 F1 分数,在 Mymensingh 上达到最高 97.26%,在最具挑战性的目标方言 Chattogram 上达到最低值 82.38%。为了提高可解释性,局部可解释模型不可知的解释(LIME)被应用于词级预测,揭示模型的决策主要由目标实体词本身的表面形式驱动,而不是由周围的句子上下文驱动。这些发现为跨方言孟加拉语 NER 建立了基准,并证明了基于Transformer的迁移学习对于资源匮乏的地区方言的有效性,同时强调了当前模型的表面形式依赖性作为未来工作的方向。