论文

En-ViMedNER:具有 UMLS 语义类型注释的英语-越南语并行生物医学语料库

En-ViMedNER: An English-Vietnamese Parallel Biomedical Corpus with UMLS Semantic Type Annotations

模型评测基准与评测资源

摘要

生物医学命名实体识别 (NER) 是医疗保健人工智能应用的基础,包括临床决策支持和医疗信息提取。虽然具有统一医学语言系统 (UMLS) 注释的语料库(例如 MedMentions)推动了英语生物医学 NER 的进步,但越南语不存在类似的资源。本文提出了 En-ViMedNER,这是第一个用 UMLS 语义类型注释的英语-越南语并行生物医学 NER 语料库,它是语言中性代码,提供共享的跨语言标签空间并确保与现有基于 UMLS 的资源的直接可比性。该语料库包含 4,392 个 PubMed 摘要对、44,892 个英语-越南语句子对以及改编自 MedMentions ST21pv 数据集的 21 个语义类型的 202,949 个对齐的实体提及对。为了平衡质量和可扩展性,我们通过自动翻译、专家译后编辑、LLM辅助标签投影以及人工验证和判断来构建语料库。我们将 En-ViMedNER 描述为一个大规模银标准语料库,具有经过人工审核和共识校正的小型测试子集。我们在两种环境下评估 En-ViMedNER:(i)越南语输入/越南语输出生物医学 NER 和(ii)英语输入/越南语输出跨语言 NER。对于越南语 NER,我们对越南语监督编码器模型、英语监督多语言编码器模型和基于提示的 LLM 进行了基准测试。最佳模型在测试集上的 F1 分数为 52.70,在迷你测试集上的 F1 分数为 53.78。对于跨语言 NER,我们对编码器-解码器模型和基于提示的 LLM 进行了基准测试。最佳模型在小型测试集上的 F1 分数为 45.44。我们公开发布我们的语料库、语料库构建管道和基线模型,以促进未来越南生物医学 NLP 研究。