论文

信念记忆:部分可观测下的智能体记忆

Belief Memory: Agent Memory Under Partial Observability

上下文与知识记忆Agent记忆

摘要

在长上下文中运行的 LLM 代理依赖外部记忆来随着时间的推移积累知识。然而,现有的方法通常将每个观察结果存储为单个确定性结论(例如,从临时错误推断“API~X 失败”),即使这些观察结果本质上是部分的并且可能是不明确的。通过致力于一个结论并放弃不确定性,这些方法引入了自我强化错误:代理根据存储的结论采取行动,从不重新审视替代方案,并随着时间的推移强化结论。为了解决这个问题,我们提出了 BeliefMem,它将记忆范式从每次观察得出一个结论转变为保留多个候选结论及其概率。具体来说,BeliefMem 将候选结论存储为单独的内存条目,每个条目都带有一个概率,当新的观察结果到达时,该概率通过噪声或规则进行更新。在检索时,所有候选者及其概率都会出现,从而使代理可以看到替代方案。由于记忆中的每个结论都保留了其概率,因此 BeliefMem 保留了确定性范式所放弃的不确定性,使智能体能够对证据充分的知识充满信心地采取行动,同时保留在新证据到达时更新其信心的能力。对 LoCoMo 和 ALFWorld 基准的实证评估表明,即使数据有限,BeliefMem 也能实现最佳平均性能,明显优于众所周知的基准。更广泛地说,这种概率记忆产生了巨大的收益,并探索了部分可观察环境中代理记忆的新方向。

信念记忆:部分可观测下的智能体记忆:论文配图
图 1:确定性内存与带有 API 超时示例的 BeliefMem。在重复 API X 超时后,确定性范式会存储“API X 失败”并在以后的会话中避免它,从而强化错误。相比之下,BeliefMem 保留多个假设(例如,失败与速率限制)的概率,重试 API,并用新证据更新信念,从而能够随着时间的推移进行纠正。