论文

当眼见为实时——基于搜索的视频错误信息检测基准

When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection

模型评测基准与评测资源

摘要

视频错误信息越来越多地在语义和证据层面上发挥作用:真实的镜头可能会被选择性地编辑、暂时重新排序、跨来源拼接,或者用人工智能生成的内容进行增强以构建虚假叙述。这种依赖证据的操作无法仅通过输入视频进行可靠验证,因为丢失、重新排序、替换或重新上下文化的证据位于视频本身之外。我们引入了 \textbf{EVID-Bench},这是基于搜索的视频错误信息检测的基准,系统必须在开放网络中搜索相关视频,并通过跨视频比较来识别哪些信息是虚假的。 EVID-Bench 包含 222 个视频,涵盖 3 个类别的 9 种操作类型:AI 生成、单源编辑和多源编辑。所有样品均经验证仅通过目视检查前沿模型无法检测到。我们使用检索增强验证基线评估九个前沿多模态模型。最好的系统只能实现 61.43% 的点级精度和 43.24% 的视频级精度,而人工智能生成的操作仍然特别具有挑战性。错误分析揭示了反复出现的挑战:模型专注于不相关的锚点,将合成内容错误地归因于编辑拼接,并在完全解释操纵之前过早终止搜索。