论文

MemEvo:自动发现流视频内存机制

MemEvo: Automatic Discovery of Streaming Video Memory Mechanisms

上下文与知识记忆Agent记忆

摘要

与查询无关的流视频理解需要视觉语言模型在知道未来的查询之前将无限增长的视觉流持续压缩到有限的内存中。性能主要取决于内存机制——要保留哪些观察结果,如何表示和合并它们,以及当查询最终到达时要检索哪些信息。我们不是手工设计单个内存架构,而是将内存设计制定为可执行内存程序的搜索问题。我们引入了一种轻量级的特定领域语言,它通过用于表示、准入、保留、整合、预算和检索的结构化原语来表达记忆机制,同时强制执行因果和有限记忆约束。尽管是结构化的,但派生程序空间仍然很大,并且包含异构的、条件相关的设计选择,其效果只能通过下游执行来评估。因此,我们提出了 MemEvo,一个 LLM 驱动的自动研究框架,它使用预训练的 LLM 作为语义感知提案模型,根据积累的实验反馈迭代生成和完善候选记忆程序。在运行时,确定性评估管道会验证和评估每个候选者,而底层视觉语言模型在整个发现过程中保持冻结。我们最终产生了一种免训练、有界内存的机制。 StreamingBench 和 OVO-Bench 上的大量实验证明了强大的流视频理解性能以及大量的上下文和推理效率。