论文
超越柏拉图洞穴的阴影:通过反事实推理评估自主主体的错误记忆
Beyond the Shadows of Plato's Cave: Evaluating False Memory in Autonomous Agents via Counterfactual Reasoning
摘要
自主Agent越来越依赖记忆来概括其训练环境之外的情况。然而,Agent受到他们所看到和相信的东西的限制,并且在未见过的环境中利用这些记忆可能会给他们的内部信念带来偏见。我们将这种现象形式化为 错误记忆,它可能由虚假相关性、环境变化和知识冲突引起。尽管错误记忆很重要,但它很难评估,因为它源于Agent的内部信念,并且很容易与普通的泛化失败相混淆。因此,我们提出了 FAME,这是一种免训练框架,通过反事实推理下Agent信念的演化来评估错误记忆。具体来说,反事实场景揭示了在假设的干预下,信念如何随着记忆的潜在概念的变化而变化;因此,测量由此产生的概念漂移提供了区分忠实记忆和错误记忆的信号。这些概念可以在答案生成之前根据Agent隐藏状态进行估计,从而避免了奖励设计或答案采样的需要。实证实验表明,简单地监控答案通常无法检测错误记忆,而 FAME 在错误记忆设置中实现了 76.2% - 96.7% 的 AUROC,并且在实际基准测试中比最佳基线高出 3.4% - 23.3%,涵盖数学推理 (GSM-Symbolic)、代码生成 (GitChameleon) 和复杂推理 (BigBench-Hard)。我们进一步发布相应的反事实模板,方便未来对错误记忆的研究。