论文

取代:诊断和训练 LLM 代理中的内存更新差距

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

模型训练上下文与知识强化学习记忆Agentic RLAgent记忆

摘要

大语言模型 (LLM) 代理在长时间的多会话交互中运行,其中事实发生变化:用户移动、价格更新、计划修改。正确行事需要使用事实的当前值并丢弃已被取代的值。我们将这种能力与真实的对话数据隔离开来,并表明这是一个明显的、未解决的失败。在 LongMemEval 的知识更新子集中,用有界的、自我维护的记忆替换智能体的完整上下文,即使在前沿模型 (gpt-5.4) 上,准确率也会从 92% 下降到 77%,这一差距在统计上具有显着性(配对 McNemar p<0.005),并且在整个模型范围内持续存在,而全上下文准确率饱和在 92% 附近。因此,瓶颈在于内存维护,而不是理解,并且无法通过更强大的模型来解决。然后我们询问这是否仅仅是内存不足,结果发现事实并非如此:随着对话增长 24 倍,准确率进一步下降(从 68% 到 28%),并且按比例授予代理更多内存不会产生可检测的恢复(28% 到 28%,n=25)。失败的程度取决于对话的长度,而不是压缩率。我们发布了 Supersede,一个开放的强化学习环境(在验证器/ prime-rl 堆栈上),它将这种测量结果转化为训练信号:代理因根据当前值进行回答而受到奖励,而因过时的值而受到惩罚。最后,我们关闭循环并表明差距是可训练的:GRPO 微调 是该环境中的一个小型开放模型 (Qwen2.5-3B),其在真实的、看不见的对话上的保留取代精度几乎翻了一番(9.0% 到 16.7%,单次运行),沿着单调检查点曲线,表明学习的策略而不是利用工具带来了增益。据我们所知,这是第一个可训练的环境,其奖励目标是时间事实流通,并且第一个证据表明替代间隙可以被训练下来,而不仅仅是测量。