论文
超越视觉界限:重新思考电影 RAG 的场景分割
Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG
摘要
理解长格式视频仍然是多模态 大语言模型 (MLLM) 的基本挑战。稀疏帧采样无法捕获细粒度的视觉细节,而密集采样很快就会超出上下文长度限制。检索增强生成(RAG)通过选择性地检索相关视频片段以进行依据视频证据生成,提供了一个有前途的中间立场,但其有效性关键取决于用作检索单元的视频片段的质量。在本文中,我们研究了用于电影理解的 RAG,这需要对跨越数小时内容的人物、事件和叙事弧进行故事级推理。场景分割是一个长期研究的问题,它将电影划分为语义一致的单元,是定义此类检索单元的自然候选者。我们通过对下游电影理解任务的综合评估,重新审视现有方法是否真正发挥了这一作用,并发现它们始终无法胜过朴素的统一时间分块。我们对最标准的场景分割基准的审核揭示了原因:当前的注释优先考虑视觉上显着的过渡而不是叙事事件结构。受这种不匹配的推动,我们引入了 NarraScene,一个以叙事为中心的场景分割数据集,用跨越物理、角色和叙事变化的三级认知分类法进行注释,其中每个有效边界都需要叙事级别的转变。当用作检索单元时,这些基于叙事的片段在下游电影理解任务上优于统一分块,这表明电影 RAG 中场景分割的主要挑战不是检测边界,而是识别对电影理解重要的叙事事件单元。