论文

我们可以相信视频幻觉探测器吗?用于评估评估器的 VidHalLoc

Can We Trust Video Hallucination Detectors? VidHalLoc for Evaluating the Evaluators

模型评测基准与评测资源

摘要

视频语言模型和视频代理可以产生与时空证据相冲突的幻觉。现有的基准主要评估模型幻觉,异构机制使得检测器的可靠性难以比较。我们推出了 VidHalLoc,这是一个基准,它使用跨视频问答和视频字幕任务的 2,000 个对抗性幻觉样本,在统一的诊断评估协议下评估幻觉检测方法,涵盖本体和动态幻觉类别。为了有效地构建 VidHalLoc,我们引入了 VideoHALO,这是一种基于 Harness Engineering 的多代理工作流程,它将数据构建分解为由内存系统和通信协议支持的四个可执行阶段。对 15 种方法的评估表明,四种专用检测器的总体准确度峰值仅为 34.63%,表明视频幻觉类型的可靠性有限 [数据集存储库:https://huggingface.co/datasets/wesfggfd/VidHalLoc]。