论文

CMI-Mem:经条件互信息增强强化学习迈向可泛化的长期记忆管理

CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning

上下文与知识模型训练强化学习记忆Agentic RLAgent记忆

摘要

记忆管理器模型在智能体系统中至关重要。既有强化学习方法常用LLM判分的合成问答(QA)对:这提供了有用的下游任务落地,但通过采样查询分布与固定阅读器来为记忆赋值。我们提出CMI-Mem,一个带混合奖励的轻量RL记忆管理器:外在QA项度量终端任务正确性,内在条件互信息(CMI)项在不以采样QA查询为条件的情况下,评估新对话输入相对当前记忆状态贡献的信息。两个信号互补:QA锚定任务效用,CMI为相关、非冗余的记忆构建提供逐操作监督。实验显示跨记忆使用场景的迁移改善,以及来自逐操作CMI信号的更高效训练与推理。代码见https://github.com/Wyb0627/CMIMem,CMI-Mem-4B模型检查点见modelscope。

CMI-Mem:经条件互信息增强强化学习迈向可泛化的长期记忆管理:论文配图
图 1:CMI-Mem 中的两种奖励途径。右图隔离了添加的 CMI 途径;完整的培训目标保留了左侧的 QA 路径并结合了两种奖励。