论文

VideoEvolve:联合优化长视频记忆与检索

VideoEvolve: Co-Evolving Memory and Retrieval for Long Video Understanding

模型训练上下文与知识强化学习检索增强记忆

摘要

长视频理解越来越依赖外部存储器将大量视觉流组织成紧凑的表示。然而,大多数基于记忆的方法会动态调整针对不同问题检索信息的方式,同时在很大程度上固定所记住的内容。这种不匹配使得丢失的详细信息恢复起来成本高昂,而存储的信息只有在能够可靠地检索时才有价值。为了解决这个问题,我们提出了 VideoEvolve,这是一种新颖的自我进化框架,可以联合进化记忆和检索以实现长视频理解。具体来说,从粗略的低帧速率概述开始,VideoEvolve 将用于选择性记忆增强的 Memory Evolver 与用于对不断发展的记忆进行自适应检索的 Retrieval Evolver 结合起来。然后,我们通过交替的 Agentic 强化学习 (Agentic RL) 共同进化两个 Evolver,更新一个,同时冻结另一个。为了引导这种交替进化,瓶颈感知进化反馈 (BEF) 会识别当前瓶颈是在内存还是检索中,并指导 朝着更具限制性的方向进行优化。此外,VideoEvolve 引入了能力感知进化反馈 (CEF),以减轻从过度专业化内存到一组固定训练问题的下游反馈,将训练转向不发达但可学习的视频功能。通过将Agentic RL与BEF和CEF集成,VideoEvolve将下游推理经验转化为可转移的能力更新,提供了从静态长视频系统到体验驱动、自我改进的多模态智能的具体路径。对多个长视频理解基准的大量实验证明了 VideoEvolve 的有效性。

VideoEvolve:联合优化长视频记忆与检索:论文原图
图 2:VideoEvolve 概述。 VideoEvolve 在两个阶段之间交替:(a) Memory Evolver 学习在 Retrieval Evolver 冻结的情况下记住什么,而 (b) Retrieval Evolver 学习如何检索更新的内存。瓶颈感知演进反馈(BEF)和能力感知演进反馈(CEF)进一步诊断当前瓶颈和能力前沿,指导下周期演进。