论文
通用 NER v2:迈向大规模多语言命名实体识别基准
Universal NER v2: Towards a Massively Multilingual Named Entity Recognition Benchmark
摘要
虽然多语言模型有望为多种语言的使用者带来 LLM 的优势,但大多数语言中用于质疑这些假设的人工参考标准评估基准仍然很少。通用 NER 项目现已进入第四个年头,致力于构建人工参考标准的多语言命名实体识别 (NER) 基准数据集。受到其他核心 NLP 任务(例如通用依赖项)现有的大规模多语言工作的启发,该项目使用通用标签集和全面的注释指南来收集命名实体范围的标准化、跨语言注释。第一期 (UNER v1) 于 2024 年发布,此后该项目一直在继续并扩大,在活跃的社区中拥有各种组织者、注释者和合作者。