论文
CV-18 NER:用于阿拉伯语语音命名实体识别的增强通用语音
CV-18 NER: Augmented Common Voice for Named Entity Recognition from Arabic Speech
摘要
端到端语音命名实体识别(NER)旨在直接从语音中提取实体。先前的研究表明,端到端(E2E)方法的性能优于英语、法语和中文的级联管道,但阿拉伯语由于其形态复杂性、缺乏短元音和有限的注释资源而仍未得到充分开发。我们引入了 CV-18 NER,这是第一个公开可用的阿拉伯语语音 NER 数据集,通过遵循细粒度 Wojood 模式(21 种实体类型)使用手动 NER 注释来增强阿拉伯通用语音 18 语料库而创建。我们基于 Whisper 和 AraBEST-RQ 对管道系统(ASR + 文本 NER)和 E2E 模型进行基准测试。 E2E 系统的性能明显优于测试集上的最佳管道配置,达到 37.0% CoER (AraBEST-RQ 300M) 和 38.0% CVER (Whisper-medium)。进一步的分析表明,阿拉伯语特定的自监督预训练产生了强大的 ASR 性能,而多语言弱监督更有效地转移到联合语音到实体学习,并且较大的模型可能更难适应这种资源匮乏的环境。我们的数据集和模型是公开发布的,为阿拉伯语语音的端到端命名实体识别提供了第一个开放基准https://huggingface.co/datasets/Elyadata/CV18-NER。