论文

GMP:并发违规与动态规则下内容审核的基准

GMP: A Benchmark for Content Moderation under Co-occurring Violations and Dynamic Rules

模型评测基准与评测资源

摘要

在线内容审核对维护健康的数字环境至关重要,对 AI 承担这项任务的依赖持续增长。设想一条用民族刻板印象侮辱政客的用户评论。这个例子体现了现实场景中的两个关键挑战:(1)并发违规,即单条帖子违反多项政策(如偏见与人身攻击);(2)动态审核规则,即违规判定取决于随情境演化的平台专属准则。并发危害与动态变化规则的交汇凸显了当前 AI 系统的核心局限:尽管大语言模型(LLM)善于遵循固定准则,但当政策不稳定或依赖情境时,其判断能力会退化。在实践中,这些缺陷导致审核不一致:要么错误限制合法表达,要么让有害内容继续留存线上。这给评估提出了一个关键问题:在现有静态基准上的高分,真的能保证 AI 判断稳健泛化到涉及并发违规与动态规则的现实场景吗?

GMP:并发违规与动态规则下内容审核的基准
图2:GMP Benchmark的数据构建流水线。①我们从公开数据集与社交媒体收集潜在有害内容,②采用LLM委员会进行标注,并以人工仲裁解决分歧,③构建最终的GMP Benchmark,其由两个子集组成,分别评估模型识别共现违规的能力与适应动态规则的能力。