论文

EvoHarmBench:通过迭代类人规避来打破内容审核

EvoHarmBench: Breaking Content Moderation with Iterative Human-Like Evasion

模型评测安全与风险评测

摘要

现有的有害内容检测评估主要依赖于静态基准,这很难反映现实世界内容平台的交互式对抗生态系统,在该生态系统中,用户不断修改自己的表达以响应审核反馈。这种不匹配在离线基准分数和在线部署效率之间造成了显着的性能差距。据我们所知,我们推出了 EvoHarmBench,这是第一个用于内容审核系统的动态对抗性评估框架。该框架采用迭代优化循环,在语义集群级别发展规避策略,同时优化规避成功和人类可读性。我们系统地评估了基于 LLM 的防御模型,这些模型广泛应用于现实世界的审核系统。该评估涵盖五个违规类别的 229 个语义子集群,这些子集群源自从内容平台收集的 5,002 个现实世界对抗样本。我们的实验揭示了即使在领先的商业系统中也存在重大漏洞:经过十二次优化迭代,在可读性限制下,SOTA LLM 主持人的攻击成功率达到 80.3%。我们将发布完整的基准数据、评估框架和代码,以鼓励内容安全研究从静态基准测试转向动态对抗性评估。