论文

Video-HolmesV2:MLLM 能否利用长视频中的时空视听证据进行推理?

Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?

模型评测基准与评测资源

摘要

多模态大语言模型已经表现出令人印象深刻的视频理解能力,但它们对长篇叙述的推理能力往往被以视觉为中心的评估和低效的上下文处理所掩盖。现有的基准过度依赖视觉启发法,同时边缘化听觉线索,有效地将模型简化为绕过真正的跨模式推理的“沉默的观察者”。此外,标准密集采样会产生证据与上下文的权衡:增加捕获证据的帧不可避免地会导致注意力分散和词元爆炸。为了弥补这些差距,我们推出了 Video-HolmesV2,这是一种专为深度视听耦合而设计的新颖基准。与之前的作品不同,它强制执行基于证据的评估,要求模型用精确的时空视听证据来证明答案的合理性,从而减少猜测和幻觉证据的混淆效应。为了支持这一点,我们引入:(1)多模型交叉验证管道以确保任务严谨性; (2)用于细粒度校准的时空证据感知指标。此外,我们提出了音频文本引导词元压缩框架。通过将任务意图与听觉锚点融合,我们的方法提炼出高价值的推理线索,以减轻长上下文噪声。在我们的评估中,即使是强大的专有模型也能达到低于 60% 的准确率,而我们的方法优于同类开源全模型。