论文
超越仇恨:在多模式内容审核中区分不文明和不宽容的言论
Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation
摘要
当前的多模式毒性基准通常使用单个二元仇恨标签。这种粗略的方法融合了两种根本不同的表达特征:语气和内容。借鉴传播科学理论,我们引入了一种细粒度的注释方案,区分两个可分离的维度:不文明(粗鲁或轻蔑的语气)和不宽容(攻击多元化和针对群体或身份的内容),并将其应用于 Hateful Memes 数据集中的 2,030 个 meme。我们在粗标签训练、跨标签方案的迁移学习以及将粗标签与细粒度注释相结合的联合学习方法下评估不同的视觉语言模型。我们的结果表明,细粒度注释补充了现有的粗标签,并且联合使用时可以提高整体模型性能。此外,与仅在仇恨标签上训练的模型相比,使用细粒度方案训练的模型表现出更平衡的与审核相关的错误概况,并且不太容易检测到有害内容(FNR-FPR,假阴性率和假阳性率之间的差异:LLaVA-1.6-Mistral-7B为0.74至0.42;Qwen2.5-VL-7B为0.54至0.28)。这项工作通过增强数据质量来提高审核系统的可靠性和准确性,从而有助于在内容审核中采用以数据为中心的方法。总体而言,结合粗粒度和细粒度标签提供了一条实现更可靠的多模式调节的实用途径。