论文
LazySloth:基于有界 LLM 的惰性树搜索,用于快速长视频理解
LazySloth: Bounded LLM-based Lazy Tree Search for Fast Long Video Comprehension
摘要
现代视觉语言模型(VLM)由于可以捕获丰富的语义信息,在长视频理解方面显示出了有希望的结果。然而,大多数方法侧重于提取图像帧的粗略字幕,这在计算上效率低下并且需要具有大上下文窗口的模型。虽然过去的工作通过多模态检索增强生成(RAG)探索了有效的方法,但它们依赖于丢失时间上下文和细粒度细节的有损嵌入。迄今为止,很少有研究研究如何优化基于 VLM 的查询相关信息检索。我们引入了 LazySloth,这是一种基于树的高效搜索方法,通过对视频 VLM 认为不相关的视频部分进行有界字幕,可以将视频理解和检索任务速度提高 2.9-8.3 倍(与现有的 Agentic 方法相比)。与当代专业视频理解 VLM 和基于 RAG 的方法相比,LazySloth 在两个最新的开源基础 VLM(Gemma 4 31B 和 Qwen3.6 27B)上的四个基准测试中实现了相似或更好的最终任务准确性。 LazySloth 缩小了基础开源模型和闭源模型 GPT-4o 之间的差距。 Ablations 表明,用基于 CLIP 的检索取代 VLM 场景理解的准确度成本为 8.8-19.9%,而惰性树构建与急切构建相匹配,而成本仅为字幕成本的一小部分。通过 LazySloth,我们展示了更快地理解长视频而不会造成性能大幅损失的可能性。