论文

自改进LLM Agent的记忆奖励膨胀

Memory Reward Inflation in Self-Improving LLM Agents

上下文与知识记忆Agent记忆

摘要

自我改进的LLM代理通过经验学习,而不更新任何权重。每个回合都被存储在外部记忆中,评分并从相似的任务中检索,以塑造后续的行为。从奖励的角度来看,存储的评分是隐式非参数化策略的代理奖励。然后,每次检索的回合成为策略改进步骤,其可靠性取决于评分是如何生产的。在部署中,不存在地面真相标签,因此存储的奖励最多是一个LLM评估。这种替换导致了基于记忆的自我改进代理和模型家族中的*Echo Gap*。错误的回合会收到膨胀的奖励;因此,代理倾向于优先使用它最自信犯错的错误。因为错误通过记忆累积而不是平均化,确认的判官的错误仍然与原始自我评价相关联,所以它无法识别哪些记忆被过度评价。缺失的属性被正式化为*错误独立性假设*(EIA),我们证明它是*必要*条件,用于纠正膨胀,而不是仅仅描述一个好的验证者:一个可用的信号必须同时跟踪真理和与记忆偏见无关的误差,且可恢复的回报是一个精确的函数这两个量。我们进一步证明,膨胀不仅在检索时根据存储的评分进行,而且在平滑相似检索中也进行,这是部署代理所使用的环境。最后,无答案的去膨胀算法LUCID在BIRD文本到SQL基准上提供了一致的端到端收益。它将执行准确率提高到56.9%,超过一个Memento风格的自我评价代理(54.0%,种子间的平均收益+2.9),以及与相同架构的无记忆代理(52.4%)。

自改进LLM Agent的记忆奖励膨胀:论文配图
图1:自改进记忆智能体中的回声差距机制,以及 LUCID 如何降低被夸大的既往经验的权重。