论文
纽伦堡 NLP @ GermEval 共享任务 2026:通过错误无关的 LLM 选民检测德国社交媒体中的有害内容
Nürnberg NLP @ GermEval Shared Task 2026: Harmful Content Detection in German Social Media through Error-Independent LLM Voters
摘要
德国社交媒体中的有害内容对现实世界造成损害,从呼吁采取行动到刑事诽谤。 GermEval 2026 共享任务在四个子任务中对其检测进行评分。技术挑战是严重的类别不平衡。有害类别很少见,并且与占主导地位的大多数类别共享表面语言,但在宏观 F1 下,它们决定分数。那么,决定性的杠杆不是更强的单一模型,而是误差独立性。这种见解成为每个子任务的九投票者集合,跨越三个正交轴:LLM、训练方法和类范围。主要基于内部交叉验证进行选择,系统在隐藏测试集上达到了 89.56 (C2A)、71.63 (DBO)、54.84 (VIO) 和 83.02 (DEF) 的宏观 F1,在所有四个子任务上均排名第一。