论文

BioUNER:临床乌尔都语命名实体识别的基准数据集

BioUNER: A Benchmark Dataset for Clinical Urdu Named Entity Recognition

模型评测基准与评测资源

摘要

在本文中,我们提出了生物医学乌尔都语命名实体识别 (BioUNER) 的人工参考基准数据集,该数据集是通过从在线乌尔都语新闻门户、医疗处方以及医院健康博客和网站爬取与健康相关的文章而开发的。经过预处理后,三位熟悉医学领域的原生注释者使用 Doccano 文本注释工具参与注释过程,并注释了 153K 个标记。注释后,对所提出的 BioiUNER 数据集进行了内在和外在评估。注释者间的一致性得分为 0.78,从而验证了数据集的黄金标准质量。为了展示该数据集的实用性和基准测试能力,我们评估了多种机器学习和深度学习模型,包括支持向量机 (SVM)、长短期记忆网络 (LSTM)、多语言 BERT (mBERT) 和 XLM-RoBERTa。黄金标准 BioUNER 数据集是一个可靠的基准,也是对乌尔都语语言处理资源的宝贵补充。