论文
长程Agent中记忆控制信号在行动之前出现
Memory Control Signals Emerge Before Action in Long Horizon Agents
摘要
长程语言模型Agent持续积累交互历史,推高计算成本,同时使相关信息更难保留与复用。现有上下文管理方法主要关注如何压缩或检索历史,但在很大程度上回避了一个问题:模型本身是否在这些记忆操作发生之前就已经表征了对它们的需求。我们研究每次Agent行动之前瞬间的隐状态,发现压缩与回忆需求已经编码在模型的内部表征中。这些信号无法用简单的上下文长度或交互进度解释,并且在不同模型深度上呈现不同的形成模式。我们进一步表明,大部分记忆决策信息保留在紧凑的近期上下文中,而选择性恢复的历史证据补充了近期上下文遗漏的长程依赖。基于这些发现,我们提出带证据检索的行动前记忆(PaMER),它把状态引导压缩与外部证据检索相结合。PaMER+进一步引入步骤级证据选择,只恢复当前任务所需的历史信息。在WorkBuddyBench上、跨多个上下文管理基线与模型骨干的实验表明,我们的框架在保持有竞争力任务性能的同时,大幅降低了上下文消耗。
