论文
MemLens:大型视觉语言模型中的多模式长期记忆基准测试
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
摘要
记忆对于大型视觉语言模型 (LVLM) 处理长时间、多模式交互至关重要,有两个方法方向提供了这种功能:长上下文 LVLM 和记忆增强代理。然而,现有的基准还没有针对真正需要多模式证据的问题对两者进行系统比较。为了弥补这一差距,我们引入了 MEMLENS,这是一种多模式多会话对话中的记忆综合基准,包括跨模式词元计数方案下的 5 种记忆能力(信息提取、多会话推理、时间推理、知识更新和答案拒绝)、四种标准上下文长度(32K-256K 词元)的 789 个问题。一项图像消融研究证实,解决 MEMLENS 需要视觉证据:删除证据图像会使两个前沿 LVLM 在 80.4% 的证据包含图像的问题上的准确度低于 2%。通过评估 27 个 LVLM 和 7 个记忆增强代理,我们发现长上下文 LVLM 通过直接视觉基础实现了较高的短上下文准确性,但随着对话的增长而降低,而记忆代理是长度稳定的,但在存储时间压缩下失去视觉保真度。多会话推理将大多数系统限制在 30% 以下,而且这两种方法都无法单独解决该任务。这些结果激发了将长上下文注意力与结构化多模态检索相结合的混合架构。我们的代码可在 https://github.com/xrenaf/MEMLENS 获取。