论文

EM^2Mem:大语言模型 以事件为中心的多模态存储器

EM^2Mem: Event-Centric Multimodal Memory for Large Language Models

摘要

多模态内存为长视频问答提供了可扩展的接口,但现有方法通常将字幕、帧、文字记录、摘要或图形事实作为孤立的片段进行检索。虽然可搜索,但此类片段尚未准备好生成:当上下文有限且归因困难时,语言模型必须在推理时重建跨模式和时间对齐。我们提出了 EM^2Mem,一种以事件为中心的多模态记忆框架,在记忆构建过程中将异构证据与事件锚点绑定。每个事件索引记忆单元都会对齐多模态记录、时间上下文、图形链接关系、语义事实和来源,从而能够在基础多模态事件而不是特定模态片段上进行紧凑的证据读出。在三个长视频 QA 基准测试中,EM^2Mem 将最强内存基线的平均准确度提高了 2.0、2.4 和 3.7 个点,将严格事件级 Top-5 证据召回率提高了 7.0 个点,并将每次查询延迟减少了 4.67 倍,总推理词元减少了 63.66%(该代码将集成到 https://github.com/zjunlp/LightMem)。