论文

语言特异性与领域多样性:Bangla Medical NER 的基准 Transformer

Language Specificity vs. Domain Diversity: Benchmarking Transformers for Bangla Medical NER

模型评测模型能力评测

摘要

由于语言变异性高和特定领域注释语料库的稀缺,低资源语言的医学命名实体识别(NER)仍然是一项具有挑战性的任务。这项工作提出了一个全面的经验基准,在 Bangla 医学 NER 的零样本和少样本提示配置下,针对 GPT-4o mini 评估三种微调 Transformer 编码器 - BanglaBERT、多语言 BERT (mBERT) 和 XLM-RoBERTa。与之前仅在 50 个样本的有限子集上评估大型语言模型的研究相比,我们对 3,179 个样本的完整测试集进行了大规模评估,提供了统计上稳健且可重复的基线。我们经过微调的 XLM-RoBERTa 模型达到了 0.5959 的 F1 分数,建立了新的最先进水平,并超越了之前报告的最佳结果 0.5848。至关重要的是,我们证明了特定语言的 BanglaBERT 模型的 F1 分数为 0.4937,其表现始终低于其多语言模型,这表明在高度专业化的临床环境中,预训练领域的多样性可以超过语言特异性。此外,我们对该任务进行了详细的按实体类型分析,表明医学和专科类别具有很高的可靠性,其 F1 分数高于 0.83,而症状类别尽管是最频繁的训练课程,但 F1 分数为 0.4367,仍然是最具挑战性的。最后,经过微调的 Transformer 模型的性能比最佳提示配置高出 3.76 倍,这证实仅提示管道仍然不足以在资源匮乏的语言环境中进行结构化临床实体提取。