论文

分布式隐性伤害:基于 MLLM 的视频审核中的构图安全盲点

Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video Moderation

模型评测安全与风险评测

摘要

尽管多模态 大语言模型 (MLLM) 在视频审核中的使用越来越多,但它却表现出组合安全盲点:由看似良性成分组成的视频在整体解释时可能会传达有害含义。我们将这种现象称为分布式隐式伤害(DIH),其中伤害源自沿视频分解轴分布的组件之间的关系,而不是源自任何单个显式线索。在许多可能的轴中,我们研究了两个代表性案例:跨视觉片段的时间分布伤害(DIH-T)和音频和视觉流之间的跨模式伤害(DIH-M)。大规模研究和缓解 DIH 需要难以收集的数据:此类视频缺乏成分危害注释,逃避基于局部视觉线索、关键词或单模态信号的检索,因此在现有安全数据集中不存在。为了弥补这一差距,我们开发了一个多智能体合成框架,该框架将各个良性组件组合成有害场景,并生成具有明确推理注释的各种 DIH 视频,从而生成包含 9,000 多个视频的数据集,涵盖纯视觉和视听设置。对涵盖前沿专有模型和领先开源系统的 30 多个 MLLM 进行基准测试,揭示了在检测 DIH-T 和 DIH-M 方面存在重大且一致的缺陷。值得注意的是,即使在最强大的前沿模型中,这种失败仍然存在:它们经常正确地评估孤立的单个组件,但无法识别其组成中出现的有害含义。我们在社交媒体上手动收集的一组真实 DIH 视频上进一步评估这些模型,并观察相同的失败模式,强调 DIH 作为视频审核的一个实际且尚未充分探索的挑战。