论文

老把戏,新模型:简单图像变换如何攻破现代基于AI的内容审核

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

模型评测安全与风险评测

摘要

尽管自动化内容审核系统已成为大规模筛查有害内容的必备手段,传统的任务专用分类器往往在政策覆盖面与语境理解上能力有限。最近,基于大型基础模型构建的商业多模态审核 API 相继推出,承诺提供更广泛、更强大的安全过滤能力。本工作分析这一转变是否也带来了更稳健的图像审核。我们对三家成熟的商业图像审核服务开展大规模黑盒评估并比较其稳健性。通过在多个提供商、数据集、危害类别、感知相似度约束和变换强度上评估七种简单且与模型无关的图像变换,我们发现:(1) 三家商业服务都可以被低成本的图像变换绕过,这些变换无需梯度、代理模型或对目标系统的了解;(2) 即便是颜色反转、灰度转换这类固定变换,也能在内容对人眼仍可辨识的情况下引发从“不安全”到“安全”的决策翻转;(3) 其稳健性在不同数据集与危害类别间差异显著,其中多模态内容与自我伤害类别表现出明显的脆弱性。由此得出的结论是:用基于基础模型的 API 替代传统审核分类器,其本身并不构成可靠的安全边界。此类系统必须在现实变换下接受评估,并作为分层审核流水线中的一个组件部署,而非独立的过滤器。

老把戏,新模型:简单图像变换如何攻破现代基于AI的内容审核:论文配图
(a) 原始图像(b) 盐和胡椒图 1:盐和胡椒转换的示例。两张图片均经过审查,仅供展示之用;所有实验都是在原始的、未经审查的数据集图像上进行的。