论文

RRM:用于长视野多模态推理的经验驱动反射检索记忆

RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning

上下文与知识记忆Agent记忆

摘要

现有的多模式长期记忆代理使用外部记忆来克服长视频可用的有限上下文。然而,大多数方法强调存储什么,而不是如何检索存储的内存。当检索变得不准确或反复无法获得有用的证据时,现有的智能体缺乏从以前的任务轨迹中诊断失败并适应未来搜索策略的机制。我们引入了反射检索记忆(RRM),这是一种用于长视野多模态推理的反射记忆框架。 RRM 通过反思性经验记忆增强了以实体为中心的多模态记忆图,从历史任务轨迹中提取可转移的程序检索知识。与保留当前视频中的事实证据的情景记忆和语义记忆不同,反思性经验记忆捕获跨任务的可重复使用的搜索策略。 RRM 将检索到的经验转换为查询级指导,而答案生成仍然仅以从当前视频中新检索到的事实证据为条件。生命周期管理机制通过使用频率、重用反馈和时间衰减进一步调节经验记忆,从而减少冗余和噪音。 RRM 在 M3-Bench-Robot、M3-Bench-Web 和 Video-MME-Long 上始终优于先前最先进的方法,证明了反射检索记忆对于长视野多模态推理的有效性。