论文
看到场景很重要:通过场景感知长视频基准揭示视频理解模型中的遗忘
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
摘要
长视频理解(LVU)仍然是多模态学习的核心挑战。尽管最近的视觉语言模型(VLM)取得了显着进展,但现有基准主要关注细粒度感知或粗略总结,对长上下文中的时间理解提供的洞察有限。在这项工作中,我们将场景定义为视频的连贯片段,其中视觉和语义上下文保持一致,与人类感知保持一致。这引出了一个关键问题:当前的 VLM 能否在较长的场景级上下文中进行有效推理?为了回答这个问题,我们引入了一个新的基准测试——SceneBench,旨在提供场景级挑战。我们的评估显示,当 VLM 尝试回答场景级问题时,准确性急剧下降,这表明远程上下文被严重遗忘。为了进一步验证这些发现,我们提出了场景检索增强生成(Scene-RAG),它通过检索和集成跨场景的相关上下文来构建动态场景记忆。此 Scene-RAG 将 VLM 性能提高了 2.50%,证实当前模型仍难以解决长上下文保留问题。我们希望 SceneBench 能够鼓励未来对 VLM 的研究,使其具有更强大、类似人类的视频理解能力。