论文
从专业化到通用化:指令调整的 LLM 用于强大的有害内容缓解
From Specialization to Generalization: Instruction-tuned LLMs for Robust Harmful Content Mitigation
摘要
大语言模型 (LLM) 在广泛的通用 NLP 任务中展示了令人印象深刻的性能;然而,它们在仇恨言论检测等敏感领域的有效性仍不清楚。之前的研究将提示 LLM 与最先进的基于编码器的模型(例如 BERT 变体(Roy 等人,2023;Dönmez 等人,2024))进行比较,仅显示出边际收益,这表明 LLM 在仇恨言论检测或缓解方面可能并不出色。在这项工作中,我们通过指令调整的角度重新审视这个问题。通过彻底统一跨越多个标签方案的 36 个英语仇恨言论数据集,我们基于 Qwen3(Qwen 团队,2025)微调了通才 LLM,专门用于缓解仇恨言论。我们的结果不仅证明了领域内基准测试中最先进的性能,而且还证明了跨域和跨语言泛化方面的重大改进——这是基于编码器的专业分类器经常遇到困难的领域。