论文

危害并不普遍:迫切需要针对社区的毒性检测

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

模型评测安全与风险评测

摘要

最先进的文本到图像生成毒性检测器采用一刀切的方法:单一通用模型对所有用户应用固定的安全准则。我们的经验证据表明,这些检测器无法保护边缘化社区:生成的标记为安全的图像中,大约 35% 被残障社区认为是有害的。在这篇立场文件中,我们主张社区特异性毒性检测(CTD)。为了证明其可行性,我们与残疾专家合作,为两个社区制定安全指南:侏儒症和盲人/弱视。使用 2,400 个带注释的 T2I 生成图像的数据集,我们证明大型视觉语言模型和现有的通用毒性检测器在零样本设置中都灾难性地无法识别这些准则下的有害内容,F1 分数低于随机猜测(F1 0.32 和 0.37)。令人鼓舞的是,基于提示的适应方法(ICL、VQA)显着提高了危害检测性能(GPT-4o:F1 0.50 和 0.78),而参数高效的 微调 改进了较小的模型(0.5b-7b,最佳 F1 0.48 和 0.59),演示次数少于 100 次,但对不断发展的指南仍然敏感。尽管取得了这些进展,CTD 性能仍远低于通用毒性检测所实现的 F1 $\约 0.9$,这凸显了持续研究工作的挑战和必要性。