论文
Homer:通过分层记忆和代理推理理解长视频
Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning
摘要
多模式 大语言模型 擅长短剪辑,但在在线环境中处理长达一小时的视频时表现不佳,其中帧是在有限的内存下增量处理的。现有的在线方法要么保留缺乏语义结构的紧凑视觉表示,要么构建围绕时间邻近性而不是显式因果链接组织的更高级别的记忆存储,从而使多跳叙事推理由 LLM 在每次查询时重建。我们使用分层在线内存探索和推理框架 \textsc{Homer} 来弥补这一差距。 \textsc{Homer} 的记忆反映了长视频的多尺度结构,从原始感知到重复出现的实体,再到通过明确的时间和因果关系连接的事件。然后,它的代理推理机以人类的方式探索这种记忆,定位相关场景,查找细节,并通过多轮记忆检索来组成答案,并使用验证和纠正每个步骤的工具。 \textsc{Homer} 在 M3-Bench-robot、M3-Bench-web 和 Video-MME-Long 上的表现优于之前的最佳代理方法 $+5.5$、$+10.8$ 和 $+4.4$ 点,并且始终如一地提升了三个不同的 LLM 主干网,表明在长视频上进行基于视觉证据的检索的模型不可知的结构能力。