论文
葡萄牙语临床命名实体识别:现代 BERT 模型和 LLM 的基准
Clinical named entity recognition in the Portuguese language: a benchmark of modern BERT models and LLMs
摘要
临床笔记包含有价值的非结构化信息。命名实体识别(NER)能够自动提取医学概念;然而,葡萄牙语的基准仍然稀缺。在本研究中,我们旨在评估基于 BERT 的模型和 大语言模型 (LLM) 用于葡萄牙语临床 NER,并测试解决多标签不平衡的策略。我们使用公共 SemClinBr 语料库和私人乳腺癌数据集,将 BioBERTpt、BERTimbau、ModernBERT 和 mmBERT 与 LLM(例如 GPT-5 和 Gemini-2.5)进行了比较。模型在相同的条件下进行训练,并使用精度、召回率和 F1 分数进行评估。探索了迭代分层、加权损失和过采样来减轻类别不平衡。基于 mmBERT 的模型取得了最佳性能(micro F1 = 0.76),优于所有其他模型。迭代分层改善了班级平衡和整体表现。多语言 BERT 模型,特别是 mmBERT,在葡萄牙语临床 NER 中表现强劲,并且可以在计算资源有限的情况下在本地运行。平衡的数据分割策略进一步提高性能。