论文

5-Dialects-BN:揭示音译对孟加拉方言的影响 LLM

5-Dialects-BN: Unmasking the Impact of Transliteration on Bangla Dialectal LLMs

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在自然语言处理 (NLP) 任务上取得了显着的进步,但对于资源匮乏的语言和方言多样化的设置,它们的能力急剧下降。世界第六大语言孟加拉语就体现了这一差距:现有资源绝大多数针对标准孟加拉语,而其地区方言却缺乏开发或评估方言感知系统所需的基准。我们通过 5-Dialects-BN 解决了​​这一差距,这是第一个多注释孟加拉方言基准,可将罗马音译与方言文本、标准孟加拉语、英语和跨五个区域变体的主观性标签对齐。该数据集包含 6,000 个手动注释条目,涵盖五种主要方言:吉大港、巴里萨尔、诺阿卡利、锡尔赫特和朗布尔(吉大港 1,900;诺阿卡利 1,500;锡尔赫特 1,200;巴里萨尔 700;朗布尔 700),反映了自然的在线可用性。每个条目都包含五个对齐的注释:原始方言文本、罗马音译、英语翻译、标准孟加拉语翻译和主观性标签(主观与客观)。注释由母语人士和语言学本科生制作并交叉验证,以确保方言的真实性和语义的保真度。由此产生的资源支持多种任务,包括方言识别、方言到标准标准化、机器翻译、主观性分类以及多语言 LLM 的参数高效 微调(例如 LoRA)。通过提供标准化的多注释基准,5-Dialects-BN 能够对 LLM 对方言多样化的孟加拉语进行原则性评估,并为低资源、方言感知的 NLP 的进一步研究奠定基础。