论文
HarmVideoBench:大型多模态模型中有害视频理解的基准测试
HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models
摘要
大型视觉语言模型 (LVLM) 最近在自动内容审核方面显示出巨大潜力,引发了人们对开发有害视频基准的兴趣日益浓厚。然而,我们发现现有作品存在两个主要局限性:1)有害视频的多层次特征被忽视。现有的基准主要将评估制定为二元分类任务,未能捕获隐含或深层的上下文危害。 2)完全没有解释性的理由。当前的框架仅衡量模型是否正确标记视频,而不是解释原因,将评估变成一个黑匣子,模型可以通过肤浅的捷径取得成功。为了解决这些问题,我们推出了 HarmVideoBench,这是一个多层诊断基准,包含 1,379 个视频和 4,137 个多项选择题。 HarmVideoBench 对三个层次维度进行基准测试:可观察证据、剪辑内部含义和剪辑外推理,旨在通过精心平衡和策划的样本来评估模型对表面线索之外的深刻理解。我们在 HarmVideoBench 上评估了 19 个领先模型,以评估它们对有害视频的多维理解。此外,我们引入了 BCR,一种与基准对齐的方法,可以预测推理边界并仅在需要时动态检索上下文。实验结果表明,BCR 极大地提高了基础模型在有害视频理解方面的性能,将宏观平均值从 61.7% 提高到了最先进的 84.4%。