论文

使用合成数据进行大规模多语言多标签情感分类

Multilingual Multi-Label Emotion Classification at Scale with Synthetic Data

模型训练合成数据

摘要

多语言环境中的情感分类仍然受到注释数据稀缺的限制:现有语料库主要是英语、单标签,并且涵盖少数语言。我们通过构建一个包含超过 100 万个多标签样本(每种语言 5 万个)的大规模综合训练语料库来弥补这一差距,该语料库涵盖 23 种语言:阿拉伯语、孟加拉语、荷兰语、英语、法语、德语、印地语、印度尼西亚语、意大利语、日语、韩语、普通话、波兰语、葡萄牙语、旁遮普语、俄语、西班牙语、斯瓦希里语、泰米尔语、土耳其语、乌克兰语、乌尔都语和越南语,使用文化适应生成和程序质量涵盖 11 种情感类别过滤。我们在相同条件下训练和比较从 DistilBERT(135M 参数)到 XLM-R-Large(560M 参数)的六种多语言 Transformer 编码器。在我们的域内测试集上,XLM-R-Large 达到了 0.868 F1-micro 和 0.987 AUC-micro。为了根据人工注释的数据进行验证,我们在 GoEmotions(英语)和 SemEval-2018 Task 1 E-c(英语、阿拉伯语、西班牙语)上对所有模型进行了零样本评估。在无门槛排名指标上,XLM-R-Large 匹配或超过纯英语专业模型,与 AP-micro (0.636) 和 LRAP (0.804) 持平,同时超越 AUC-micro(0.810 与 0.787),同时原生支持所有 23 种语言。最佳基本尺寸模型可在 https://huggingface.co/tabularisai/multilingual-emotion-classification 上公开获得