论文
信念型智能体记忆何时有用?可靠性条件化更新与来源封顶的投毒防御
When Does Belief-Based Agent Memory Help? Reliability-Conditional Updating and Provenance-Capped Poisoning Defense
摘要
我们调查基于信念的记忆何时真正改善了大型语言模型(LLM)代理。我们的工具是 Nous,一种长期记忆架构,它将每个实体属性对表示为通过封闭式贝叶斯推理更新的分类概率分布,信息论惊喜驱动信念修正和基于熵的遗忘。 LoCoMo 基准的受控消融表明,单独的贝叶斯信念更新相对于幼稚的最后写入胜利几乎没有什么好处,因为现有的会话内存基准很少包含矛盾或不同可靠的证据。然后,我们引入可靠性条件更新,从认知语言估计每次观察的可靠性,并在受控矛盾基准上表明,当观察的可信度不同时,信念更新大大优于最后写入胜利和原始内存检索。由于内容衍生的可靠性本身很容易受到操纵,因此我们进一步提出出处上限的信念更新,其中信任受来源出处而不是文本置信度的限制。在受控的内存中毒实验下,这种方法可以抵抗容量中毒攻击,同时揭示来源感知内存的效用成本和实现要求。最后,我们对相同输出的严格 token-F1 和 LLM-as-judge 评估之间的 27.5 分差异进行了量化,强调了长期记忆基准的重要可重复性问题。我们的结果表明,在需要对相互冲突和不同可信证据进行推理的环境中,基于概率信念的记忆最有益,而不是仅使用传统的对话回忆。