论文

记忆智能体

Memory Intelligence Agent

上下文与知识模型训练强化学习记忆Agentic RLAgent记忆

摘要

深度研究智能体(DRA)将LLM推理与外部工具相结合。记忆系统使DRA能够利用历史经验,这对高效推理与自主演化至关重要。现有方法依赖从记忆中检索相似轨迹来辅助推理,但存在记忆演化低效、存储与检索成本不断上升等关键局限。为解决这些问题,我们提出一种新颖的记忆智能体(Memory Intelligence Agent, MIA)框架,由Manager-Planner-Executor架构构成。Memory Manager是一个可存储压缩历史搜索轨迹的非参数记忆系统。Planner是一个能为问题生成搜索计划的参数化记忆智能体。Executor是另一个可依据搜索计划搜索并分析信息的智能体。为构建MIA框架,我们首先采用交替强化学习范式来增强Planner与Executor之间的协作。此外,我们使Planner能在测试时学习期间持续演化,更新随推理即时进行而不中断推理过程。另外,我们在参数化与非参数化记忆之间建立双向转换回路,以实现高效记忆演化。最后,我们引入反思与无监督判断机制,以促进开放世界中的推理与自我演化。跨十一个基准的大量实验证明了MIA的优越性。

记忆智能体:论文配图
图 1:(a)。 LiveVQA(多模态)数据集上前沿LLM与 MIA 增强型LLM之间的比较。 (二)。前沿LLM与 MIA 增强型LLM在 HotpotQA(纯文本)数据集上的比较。 (三)。基于 Qwen2.5-VL-7B Executor 的 MIA 与更大的 LLM(在非工具调用设置中)在七个不同数据集上的比较。 (d).基于 Qwen-2.5-VL-7B Executor 的 MIA 和 SOTA 内存框架在七个不同数据集上的比较。