论文
数据增强何时有帮助?评估 Hausa 和 Fongbe NLP 的 LLM 和反向翻译方法
When Does Data Augmentation Help? Evaluating LLM and Back-Translation Methods for Hausa and Fongbe NLP
摘要
数据稀缺限制了资源匮乏的非洲语言的 NLP 开发。我们评估了两种数据增强方法——基于 LLM 的生成(Gemini 2.5 Flash)和反向翻译(NLLB-200)——针对豪萨语和丰贝语,这两种西非语言在 LLM 生成质量上存在很大差异。我们使用 MasakhaNER 2.0 和 MasakhaPOS 基准评估命名实体识别 (NER) 和词性 (POS) 标记的增强。我们的结果表明,增强效果取决于任务类型,而不是仅取决于语言或 LLM 质量。对于 NER,这两种方法都没有比任何一种语言的基线都有改进; LLM 增强将 Hausa NER 降低了 0.24% F1,将 Fongbe NER 降低了 1.81% F1。对于词性标注,LLM 增强将 Fongbe 准确率提高了 0.33%,而反向翻译将豪萨语提高了 0.17%;反向翻译使 Fongbe POS 降低了 0.35%,对 Hausa POS 的影响可以忽略不计。同样的 LLM 生成的合成数据对 Fongbe 的任务产生了相反的影响——损害 NER,同时帮助 POS——这表明任务结构比合成数据质量更能控制增强结果。这些发现挑战了 LLM 生成质量预测增强成功的假设,并提供了可行的指导:数据增强应被视为特定于任务的干预措施,而不是普遍有益的预处理步骤。