论文

TurEngMix:土耳其语-英语代码混合语言识别和命名实体识别的文本语料库和基准

TurEngMix: A Text Corpus and Benchmark for Turkish-English Code-Mixed Language Identification and Named Entity Recognition

模型评测基准与评测资源

摘要

自然语言处理系统在代码混合文本上表现不佳,特别是对于资源匮乏的语言对。土耳其语-英语提出了进一步的挑战:它让英语词干与土耳其语后缀结合起来形成单一的混合语言标记。我们引入了 TurEngMix,这是一个由 5.5K 个嘈杂、自然发生的社交媒体帖子(486,974 个标记)组成的语料库,其中包含丰富的土耳其语-英语代码混合。从这个语料库中,我们构建了一个新的土耳其语-英语基准,用于代码混合语言识别 (LID) 和命名实体识别 (NER),其中包含 15K 个专家注释的标记。评估解码器 LLM 和微调编码器基线,我们发现单语土耳其语和英语标记被可靠地标记,但所有模型在 LID 和 NER 的混合语言标记上都有很高的错误率。对于形态整合的标记,GPT-4o 和 Qwen 的 NER 错误率分别高出 5.2 倍和 6.3 倍。这凸显了形态整合仍然是一个挑战。我们发布语料库、注释和代码,以支持未来关于土耳其语-英语代码混合的计算和社会语言学研究。