论文
RuleSafe-VL:评测视觉语言内容审核中的规则条件决策推理
RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation
摘要
平台内容审核应用明确的策略规则和上下文相关条件来决定是否允许、限制或删除用户内容。因此,正确的调解结果必须取决于案件激活哪些规则、这些规则如何相互作用以及现有证据是否充分。当前的多模态安全基准在很大程度上减少了匹配预定义最终标签的审核,使这一底层规则结构未经测试。因此,高基准分数几乎无法揭示模型是否正确应用策略或通过表面线索得出正确的标签。为了评估这个规则管理的过程,我们引入了 RuleSafe-VL,这是视觉语言内容审核中规则条件决策推理的基准。 RuleSafe-VL 源自公开可用的平台审核策略,形式化了 93 条原子规则和 92 种类型化规则关系,在三个高风险策略系列中生成了 2,166 个上下文敏感的图像文本案例。它的四个诊断任务将适度分解为规则条件的决策链。他们识别激活的规则,恢复规则交互,判断决策充分性,并在提供缺失上下文时解决结果。在 10 个前沿、开源和安全导向的 VLM 上进行的实验表明,规则关系恢复是主要瓶颈,最佳模型仅达到 64.8 Macro-F1,一些安全导向模型低于 7 Macro-F1。决策状态预测也仍然不可靠,峰值为 64.5 Macro-F1。 RuleSafe-VL 将调节评估从最终标签评分转向规则条件决策推理的诊断评估。
