论文

EuroAlpaca:欧洲语言指令数据的任务保留本地化

EuroAlpaca: Task-Preserving Localisation of Instruction Data for European Languages

模型训练合成数据

摘要

机器翻译 (MT) 提供了一种可扩展的方法,可将英语指令调整数据扩展到多种语言,但它可能会扭曲任务关键型约束和所需的输出,从而创建损坏的训练示例并降低在此类数据上训练的模型的性能。我们引入了 EuroAlpaca,一个任务保留本地化管道和近乎并行的资源,涵盖 50 种欧洲语言和区域品种,以及 Euro-IFEval,一个用于可验证指令遵循的多语言基准。根据示例,我们的管道应用领域智能机器翻译,同时保留任务关键内容或重建任务等效的目标语言实例,然后验证跨领域一致性和目标语言一致性。在使用四个 LLM 的 LoRA 实验中,直接翻译数据的训练改进了 Aya 评估套件上的 ROUGE-L 和 F-BERT,但相对于未适应的基线,European-IFEval 的准确性降低了 29.8%。相比之下,EuroAlpaca 的适应比相同基线提高了 12.9% 的准确率,扭转了直接 MT 造成的退化,同时还在 Aya 上实现了最高的 ROUGE-L 和 F-BERT 分数。这些结果表明,保留任务语义对于多语言指令调整至关重要。