论文
分数之下:重新思考视频理解模型的幻觉评估
Beneath the Scores: Rethinking Hallucination Evaluation for Video Understanding Models
摘要
视频理解越来越多地由多阶段 LLM 代理执行,这些代理将时间基础、视觉观察和推理分开。然而,这些阶段通常是根据不同的基准和分布进行评估的,因此很难确定幻觉的起源。我们首先围绕这些阶段组织现有的基准,并表明它们的分数提供了不一致的诊断信号:更强的阶段级性能并不可靠地意味着更低的下游幻觉,甚至针对相同功能的基准也可能不一致。因此,我们引入了一种因果阶段干预协议,该协议会覆盖各个阶段,同时保持下游任务固定。在三种视频代理架构上的 60,008 次运行中,我们发现时间片段定位是下游错误的主要来源,其因果影响大约是破坏视觉观察结果的四倍。成功的时间片段定位主要取决于定位正确的区域,而不是精确的时间重叠,这解释了为什么标准 MIoU 指标很难预测下游可靠性。我们进一步发现,错误的证据比缺失的证据危害更大。最后,根据这些干预措施审核现有基准表明,它们的分数不能可靠地预测因果级联敏感性,并且可能在分布转移下失败。这些结果激发了对值得信赖的视频代理进行基于干预的、阶段感知的评估。