论文

挖掘 大语言模型 获取低资源语言数据:比较豪萨语和 Fongbe 的启发策略

Mining Large Language Models for Low-Resource Language Data: Comparing Elicitation Strategies for Hausa and Fongbe

模型训练合成数据

摘要

大语言模型 (LLM) 使用低资源语言社区提供的数据进行训练,但这些模型中编码的语言知识仍然只能通过商业 API 访问。本文研究了策略提示是否可以从 LLM 中提取两种西非语言的可用文本数据:豪萨语(亚非语,大约 8000 万使用者)和 Fongbe(尼日尔-刚果语,大约 200 万使用者)。我们系统地比较了两种商用 LLM(GPT-4o Mini 和 Gemini 2.5 Flash)的六种启发任务类型。 GPT-4o Mini 每次 API 调用提取的可用目标语言单词比 Gemini 多 6-41 倍。最佳策略因语言而异:豪萨语受益于功能性文本和对话,而丰贝语则需要受限的生成提示。我们发布所有生成的语料库和代码。