论文

MemoryCard:用于长视频问答的主题感知多模态线索压缩

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

上下文与知识上下文工程

摘要

长视频问答对于视觉语言模型(VLM)来说仍然具有挑战性,因为与答案相关的证据通常是稀疏的、短暂的,并且在时间上分散在长视频上下文中。现有的以帧为中心的方法通过统一采样、查询感知帧选择、视觉词元压缩和自适应分辨率策略来提高效率。然而,它们仍然依赖孤立和碎片化的帧​​作为基本证据单元,限制了 VLM 有效捕获连贯事件级语义的能力。为了解决这个限制,我们提出了 MemoryCard,这是一种基于视频内存的增强框架,可将长视频组织到独立的存储卡中。具体来说,MemoryCard 首先对视频和对齐的话语执行自读取过程,将视频分割成语义连贯的单元,每个单元对应一个不同的主题或事件。对于每个单元,它生成一个事件级视频要点并选择代表性的视觉时刻,然后将其渲染到统一的存储卡中以供检索和回答问题。实验结果表明,MemoryCard 在可比视觉 词元预算 下持续提高长视频 QA 性能,准确度相对提高高达 21.8%。所有代码均可在 https://github.com/NEUIR/MemoryCard 获取。