论文

诚实的谎言:理解反射代理中的记忆虚构

Honest Lying: Understanding Memory Confabulation in Reflexive Agents

模型评测模型行为与机制分析

摘要

反射式智能体依靠自我生成的反射作为记忆,隐含地假设智能体可以准确地诊断自己的故障。我们表明,这种假设可能会系统性地失败:在 ALFWorld 和 HumanEval 中,智能体存储对任务的自信但不正确的解释,并在试验中继续对它们采取行动,即使环境每次都会重置为正确的任务。我们将这种故障模式称为内存组合,并引入反射重复率 (RRR),这是一种基于日志的指标,可检测对不正确反射内容的重复依赖。使用 RRR,我们在 ALFWorld 中识别出 16 个冻结环境,其中 121 个反射中的 0 个提到了正确的目标对象,在 HumanEval 中识别出 4 个类似情况。我们的缓解措施用轨迹级故障信号的编程提取取代了开放式自我诊断,将正确的对象提及率从 0% 提高到 86%,将 RRR 从 0.64 降低到 0.10,并解决了 16 个冻结的 ALFWorld 环境中的 3 个,这表明反射记忆可以强化错误信念,而不是纠正它们。