论文

V-Mem:长期多模态Agentic记忆的模态路由检索

V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory

上下文与知识记忆Agent记忆

摘要

用户与语言模型代理之间的交互正变得多模态:对话中同时包含文本和图像,后续问题可能指向文本或图像。然而,大多数代理的记忆设计都围绕文本,甚至少数支持多模态对话的代理也未能解决视觉相关的问题。这种失败归因于他们依赖的相似性搜索背后的假设:在索引空间中,查询与答案其相关证据接近。在多模态设置中,两个差距打破了它。通过模态差距,查询与其模态内容更接近的证据,甚至在经过训练的联合嵌入空间中也是如此,即使证据存在于另一个模态中。通过相似性-相关性差距,与查询最相似的内容往往不是回答它的证据,最明显地当查询包含文本和图像,而其证据与单独部分相似时。我们提出V-Mem,这是一种多模态代理记忆系统,通过查询和目标证据的模态识别来路由检索。为跨越模态差距,V-Mem将对话划分为轮次,并从匹配的轮次返回目标模态内容,而不进行模态之间的比较。为闭合相似性-相关性差距,它使用一个LLM生成的锚点,该锚点比查询更接近相关的证据:对于文本查询,一个假设的文本描述,对于包含文本和图像的查询,一个增强的搜索锚点,包含从查询图像中提取的相关关键词。在Mem-Gallery上,V-Mem的LLM评审得分为0.82,次佳方法为0.56,最大差距在包含图像的问题上(0.87,没有基准超过0.47);在LoCoMo上,其得分为0.69,次佳方法为0.58。

V-Mem:长期多模态Agentic记忆的模态路由检索:论文配图
图1:相似性搜索失败(红色)而 V-Mem 成功(绿色)的三种情况:(1) 找到正确图片,但证据位于图片周围的文字;(2) 仅凭查询文本找不到目标图片;(3) 必须结合查询中的文字与图片才能找到证据。示例仅作说明。