论文
面向长程LLM智能体的元认知记忆策略优化
Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents
摘要
记忆增强的LLM智能体通过将交互轨迹递归总结为紧凑记忆来处理复杂的长程任务。然而,现有方法通常使用基于结果的强化学习来训练这些记忆策略,无法定位中间记忆质量在何处退化。随着交互展开,含糊的递归总结逐渐丢弃与任务相关的信息并引入语义噪声。这加剧了信念偏离,模糊了智能体对潜在任务状态的估计,最终使长程推理脱轨。因此我们主张,记忆优化不应只关注轨迹层面的成功,而应关注中间总结所诱导信念的清晰度。为此,我们引入信念熵(Belief Entropy),一种自监督代理指标,探测在给定当前记忆的情况下模型对潜在任务状态还剩多少不确定性。基于该代理指标,我们提出元认知记忆策略优化(MMPO)。MMPO不再仅依赖稀疏的基于结果的信号,而是通过显式惩罚诱导高认知不确定性的总结,提供细粒度、针对记忆的监督。实验表明,MMPO在多样的长程任务上持续优于现有方法,即使扩展到1.75M token上下文仍保持97.1%的性能。
