论文
多语言 NER 的生成模型与编码器模型:Naamapadam 的综合实证研究
Generative vs. Encoder Models for Multilingual NER: A Comprehensive Empirical Study on Naamapadam
摘要
语言是人类最重要的技术,但对于印度宪法认可的 22 种语言中超过 10 亿的使用者来说,其数字层在结构上仍然不完整。命名实体识别 (NER) 是将原始文本转换为机器可解释知识的基本步骤,已针对英语进行了详尽的研究,但在大多数印度语言中仍未得到解决。本文对 Naamapadam 基准的所有 11 种语言的 NER 生成式和基于编码器的神经架构进行了严格的比较研究。我们评估了涵盖序列到序列 Transformer 和多语言编码器的五个经典模型系列;四个仅解码器 大语言模型 (LLM),通过 LoRA 和 4 位 NF4 量化进行微调;以及九个零到五次推理的生成模型。在严格的 CoNLL 跨度评估下,基于编码器的模型(mBERT 和 XLM-R,印地语上的 F1=0.675)在 11 种语言中的 10 种中明显优于每种生成架构,与最强竞争对手(Gemma-2-2B:平均 F1=0.427)的差距为 7.5-40 个百分点。最好的少样本结果仅达到编码器基线的 28%。我们确定了三种语言集群——编码器主导、部分覆盖和故障区域;并提供基于迁移学习和低资源 NLP 原则的可行部署指南。