论文
GMP:并发违规与动态规则下内容审核的基准
GMP: A Benchmark for Content Moderation under Co-occurring Violations and Dynamic Rules
摘要
在线内容审核对维护健康的数字环境至关重要,对 AI 承担这项任务的依赖持续增长。设想一条用民族刻板印象侮辱政客的用户评论。这个例子体现了现实场景中的两个关键挑战:(1)并发违规,即单条帖子违反多项政策(如偏见与人身攻击);(2)动态审核规则,即违规判定取决于随情境演化的平台专属准则。并发危害与动态变化规则的交汇凸显了当前 AI 系统的核心局限:尽管大语言模型(LLM)善于遵循固定准则,但当政策不稳定或依赖情境时,其判断能力会退化。在实践中,这些缺陷导致审核不一致:要么错误限制合法表达,要么让有害内容继续留存线上。这给评估提出了一个关键问题:在现有静态基准上的高分,真的能保证 AI 判断稳健泛化到涉及并发违规与动态规则的现实场景吗?
