论文

M2A:面向长期个性化交互、具备双层混合记忆的多模态记忆智能体

M2A: Multimodal Memory Agent with Dual-Layer Hybrid Memory for Long-Term Personalized Interactions

上下文与知识记忆Agent记忆

摘要

本工作应对长期人机交互中个性化问答的挑战:当对话历史跨越数周或数月并超出上下文窗口时,现有个性化机制难以持续吸收并利用用户的增量概念、别名与偏好。当前的个性化多模态模型大多是静态的——概念在初始化时固定,无法在交互过程中演化。我们提出M2A,一个智能体式的双层混合记忆系统,通过在线更新维护个性化多模态信息。该系统采用两个协作智能体:ChatAgent管理用户交互并自主决定何时查询或更新记忆,而MemoryManager将来自ChatAgent的记忆请求分解为对双层记忆库的详细操作;该记忆库将RawMessageStore(不可变的对话日志)与SemanticMemoryStore(高层观察)相耦合,提供不同粒度的记忆。此外,我们开发了一个可复用的数据合成流水线,将来自Yo'LLaVA与MC-LLaVA的基于概念的会话注入LoCoMo长对话,同时保持时间连贯性。实验表明,M2A显著超越基线,说明将个性化从一次性配置转变为共同演化的记忆机制,为长期多模态交互中的高质量个性化回复提供了一条可行路径。代码可在 https://github.com/Little-Fridge/M2A 获取。

M2A:面向长期个性化交互、具备双层混合记忆的多模态记忆智能体
图2:M²A 框架概览。M²A 采用多智能体架构,包括用于用户交互的 ChatAgent 与用于自主记忆操作的 MemoryManager。该系统利用双层混合记忆库(Dual-Layer Hybrid Memory bank),通过证据 ID 将 Semantic Store 中的高层语义观察与 Raw Message Store 中不可变的对话日志关联起来。