论文

SenBen:用于可解释内容审核的敏感场景图

SenBen: Sensitive Scene Graphs for Explainable Content Moderation

模型评测基准与评测资源

摘要

内容审核系统将图像分类为安全或不安全,但缺乏空间基础和可解释性:它们无法解释检测到的敏感行为、涉及的人员或发生的地点。我们引入了敏感基准(SenBen),这是第一个针对敏感内容的大规模场景图基准,包括来自 157 部电影的 13,999 帧,并用视觉基因组风格的场景图注释(25 个对象类、28 个属性,包括疼痛、恐惧、攻击性和痛苦等情感状态,14 个谓词)和 5 个类别的 16 个敏感度标签。我们使用多任务配方将前沿 VLM 提炼为紧凑的 241M 学生模型,通过基于后缀的对象标识、词汇感知召回 (VAR) 损失和具有不对称损失的解耦 Query2Label 标签头解决自回归场景图生成中的词汇不平衡问题,与标准交叉熵训练相比,SenBen Recall 提高了 6.4 个百分点。在带空间定位的场景图指标上,我们的学生模型优于除Gemini之外所评估的VLM,以及所有被评估的商业安全API,同时在所有模型中实现了最高的对象检测和字幕得分,推理速度提高了 7.6 倍,GPU 内存减少了 16 倍。