论文

面向长程LLM智能体的元认知记忆策略优化

Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents

上下文与知识模型训练强化学习记忆Agentic RLAgent记忆

摘要

记忆增强的LLM智能体通过将交互轨迹递归总结为紧凑记忆来处理复杂的长程任务。然而,现有方法通常使用基于结果的强化学习来训练这些记忆策略,无法定位中间记忆质量在何处退化。随着交互展开,含糊的递归总结逐渐丢弃与任务相关的信息并引入语义噪声。这加剧了信念偏离,模糊了智能体对潜在任务状态的估计,最终使长程推理脱轨。因此我们主张,记忆优化不应只关注轨迹层面的成功,而应关注中间总结所诱导信念的清晰度。为此,我们引入信念熵(Belief Entropy),一种自监督代理指标,探测在给定当前记忆的情况下模型对潜在任务状态还剩多少不确定性。基于该代理指标,我们提出元认知记忆策略优化(MMPO)。MMPO不再仅依赖稀疏的基于结果的信号,而是通过显式惩罚诱导高认知不确定性的总结,提供细粒度、针对记忆的监督。实验表明,MMPO在多样的长程任务上持续优于现有方法,即使扩展到1.75M token上下文仍保持97.1%的性能。

面向长程LLM智能体的元认知记忆策略优化:论文配图
图 1:MMPO 概述。 (上)现有的基于结果的记忆策略受到稀疏的信用分配的影响,无法防止模糊的摘要积累信念偏差。 (下)MMPO 引入了基于锚定问题的信念熵来提供密集的、特定于记忆的监督。这种对认知不确定性的细粒度惩罚保留了更清晰的总结引发的信念,并改善了长上下文推理。