论文
多语言教师:评估多语言合成数据生成的语言模型
Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation
摘要
综合来自语言模型 (LM) 的监督微调 (SFT) 数据来教授较小的模型多语言任务已经变得越来越普遍。然而,教师模型的选择通常是临时的,通常默认为最大的可用选项,即使此类模型在非英语语言中可能存在显着的能力差距。这种做法可能会导致合成数据质量差和学生下游表现不佳。在这项工作中,我们系统地描述了如何成为一名高效的多语言教师。我们将数据质量的内在衡量标准与学生模型的外在表现结合起来,称为“多语言分数”。我们评估了 6 种不同类型语言的 10 个 LM,生成了超过 140 万个 SFT 示例并训练了 240 个学生模型。我们的分析表明,模型规模本身并不能显着预测教师的有效性:我们确定的最有效的教师始终小于评估的最大模型,并且它们的排名在学生基础模型系列中保持稳定。相反,提示多样性、长度和回答流畅性等数据质量捕获了内在数据质量的 93.3% 的差异并预测学生的表现。最后,我们提供了实用的建议,包括匹配师生对的模型族,生成对现有提示的响应或从英语翻译它们,这可以为资源较少的语言带来改进。我们希望我们的工作能够推进多语言合成数据和语言模型开发方面以数据为中心的研究。