论文

面向长期对话的交互式记忆学习

Interactive Memory Learning for Long-Term Conversations

上下文与知识模型训练强化学习记忆Agentic RLAgent记忆

摘要

大语言模型的最新进展显着增强了代理建模长期对话的能力。尽管取得了这些成功,现有方法通常采用静态启发式范例,其中信息是被动存档的,没有自适应内存评估。因此,这些方法无法自我进化,也无法使内存管理与不断变化的用户需求保持一致。为了解决这个问题,我们提出了 ICML(交互式记忆学习),这是一种多智能体框架,可将记忆机制从被动存档转变为可学习的交互式记忆策略。具体来说,我们首先采用会话合成管道来生成专家数据,从而促进在未见过的场景中快速适应测试时间。在此基础上,ICML 利用在线强化学习机制,其中 Planner 代理选择性地编码高价值信息,而 Trigger 代理动态检索它以优化响应质量,从而两个代理通过持续的交互反馈共同进化。至关重要的是,两个代理通过延迟奖励机制进行同步,该机制将未来的反馈传播回早期的存储决策,确保内存策略与用户期望精确一致。实验结果表明,ICML 显着优于强大的基线,展现出随着交互积累而不断提高响应质量的独特能力。

面向长期对话的交互式记忆学习:论文配图
图1:面向长期对话的ICML框架。智能体在长期交互中利用环境反馈区分高价值记忆与低价值噪声,实现在线自演化。