论文
并非对所有人都安全:审计文生图安全流水线中的方言惩罚
Not Safe for All: Auditing the Dialect Penalty in Text-to-Image Safety Pipelines
摘要
文本到图像 (T2I) 安全护栏无法公平地推广到非标准方言。通过评估五种英语方言的 23,080 个配对提示,我们将这种失败形式化为方言惩罚,其中过滤器根据语言表面特征而不是语义意图触发。文本级过滤器在相反的方向上失败:NSFW-T 过度标记良性方言提示,而 LatentGuard 过度标记有毒方言提示(偏差差距高达 +28.29 pp),而 OpenAI 审核 API 检测不足。受控的拼写错误消融证实了这种惩罚源于标记方言特征,而不是通用的分布外敏感性。像素级生成器很大程度上与方言无关;惩罚进入文本处理并不均匀地级联到事后护栏。我们证明这种偏差跟踪训练数据不平衡,并且可以通过组平衡再训练来缓解,并将增益归因于平衡暴露而不是 GroupDRO(组分布鲁棒优化)的最差组目标。当前的管道系统地失败了方言使用者,这是一种被平均准确度基准掩盖的公平失败。我们的官方代码和数据集可在 https://github.com/minguinho26/dialect-penalty-t2i 上公开获取。内容警告:本文包含冒犯性、有毒或令人不安的文本提示和生成的图像。