论文

利用网络规模数据和集成 LLM 注释实现广义跨语言仇恨语言检测

Toward Generalized Cross-Lingual Hateful Language Detection with Web-Scale Data and Ensemble LLM Annotations

模型训练合成数据

摘要

我们研究大规模未标记网络数据和基于 LLM 的合成注释是否可以改善多语言仇恨语音检测。从通过 OpenWebSearch.eu~(OWS) 抓取的四种语言(英语、德语、西班牙语、越南语)的文本开始,我们追求两种互补的策略。首先,我们通过在受监督的 微调 之前对未标记的 OWS 文本继续进行掩码语言建模,将连续的 预训练 应用于 BERT 模型,并表明,这在 16 个基准测试中比标准基线产生了约 3% 的平均宏观 F1 增益,在低资源设置中增益更大。其次,我们使用四个开源 LLM(Mistral-7B、Llama3.1-8B、Gemma2-9B、Qwen2.5-14B)通过三种集成策略生成合成注释:均值平均、多数投票和 LightGBM 元学习器。 LightGBM 集成始终优于其他策略。这些合成标签上的 微调 极大地有益于小型模型(Llama3.2-1B:+11% 合并 F1),但仅为较大的 Qwen2.5-14B(+0.6%)提供适度的增益。我们的结果表明,网络规模的未标记数据和 LLM 集成注释的组合对于较小的模型和资源匮乏的语言来说是最有价值的。