论文
以记忆推理:面向免训练长视频理解的时间粒度自适应框架
Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding
摘要
尽管多模态大语言模型(MLLM)在基础视频任务中展现出出色的泛化能力,受限的上下文窗口限制了它们对长视频的理解。为适应这一约束,模型通常求助于关键帧选择。然而,均匀采样或静态的查询引导选择常常忽视关键的时间上下文,无法适应不同查询各异的时间粒度。本文提出ReMem,一个面向免训练LongVideoQA的时间粒度自适应关键帧选择框架。ReMem引入双层记忆增强适配。在查询层面,记忆驱动的问题解析(Memory-Driven Question Parsing)利用LLM长期记忆来解读问题的时间粒度并抽取语义实体。在视频层面,协同双语义帧对齐(Synergistic Dual-Semantic Frame Alignment)利用内在的结构记忆将帧与查询语义对齐,引导结构感知动态帧路由(Structure-Aware Dynamic Frame Routing)对事件进行聚类并最优分配采样预算。通过记忆机制显式保留时间信息,ReMem抑制冗余,并使MLLM能够执行稳健的多粒度视频推理。在四个流行的LongVideoQA基准上使用三个MLLM的评估展示了高效且最先进的零样本性能;值得注意的是,配备ReMem的LLaVA-Video在LVBench上达到54.5%(+12.3%),在LongVideoBench上达到67.1%(+8.2%)。
