论文

长程Agent中记忆控制信号在行动之前出现

Memory Control Signals Emerge Before Action in Long Horizon Agents

上下文与知识上下文工程记忆Agent记忆

摘要

长程语言模型Agent持续积累交互历史,推高计算成本,同时使相关信息更难保留与复用。现有上下文管理方法主要关注如何压缩或检索历史,但在很大程度上回避了一个问题:模型本身是否在这些记忆操作发生之前就已经表征了对它们的需求。我们研究每次Agent行动之前瞬间的隐状态,发现压缩与回忆需求已经编码在模型的内部表征中。这些信号无法用简单的上下文长度或交互进度解释,并且在不同模型深度上呈现不同的形成模式。我们进一步表明,大部分记忆决策信息保留在紧凑的近期上下文中,而选择性恢复的历史证据补充了近期上下文遗漏的长程依赖。基于这些发现,我们提出带证据检索的行动前记忆(PaMER),它把状态引导压缩与外部证据检索相结合。PaMER+进一步引入步骤级证据选择,只恢复当前任务所需的历史信息。在WorkBuddyBench上、跨多个上下文管理基线与模型骨干的实验表明,我们的框架在保持有竞争力任务性能的同时,大幅降低了上下文消耗。

长程Agent中记忆控制信号在行动之前出现:论文配图
图 2:在动作执行前读取记忆需求。该图将压缩与召回描绘为预测目标。在部署的控制器中,压缩头从任务前缀和 Recent2 读取最终状态。召回探针仅用于分析,不作为在线检索门控。