论文

低资源命名实体识别中 BERT 模型与大模型的比较:以马拉地语为例

BERT-based Models vs. Large Language Models for Low-Resource Named Entity Recognition: A Comparative Study on Marathi

模型评测模型能力评测

摘要

马拉地语等低资源语言的命名实体识别受到标注资源不足与语言复杂性的限制。尽管通用大模型在多种自然语言处理任务中表现较好,其在低资源语言特定实体识别中的效果尚不明确。研究在 MahaNER 数据集的不同版本上微调 MahaBERT-v2,系统比较微调模型、既有 MahaNER 基线及 Gemini、LLaMA-3.3-70B、Gemma 等通用大模型。所有模型均在马拉地语实体识别测试集上以精确率、召回率和 F1 评估。结果显示,微调的 MahaBERT 模型整体优于既有基线与全部受测大模型,F1 为 0.88–0.91;既有 MahaNER 基线为 0.8843,所测大模型方法为 0.57–0.69。结果支持以相关领域数据训练、面向具体任务与语言的模型在马拉地语实体识别中的优势,也说明低资源语言处理中专门架构仍有价值。