论文
MemTrace:用于长视野编码智能体的状态一致记忆
MemTrace: State-Consistent Memory for Long-Horizon Coding Agents
摘要
当编码智能体承担跨越多个文件和阶段的长期软件演化任务时,较长的执行轨迹会带来两个耦合的挑战:(1) 累积的历史记录会导致上下文预算紧张,(2) 存储库更改可能会使早期的执行证据失效。现有的方法通过更大的上下文窗口、压缩、检索或存储库表示等技术来解决这些挑战,但通常无法在上下文刷新后重建一致的任务状态或验证召回的证据是否仍然有效。因此,我们引入了 MemTrace,这是一个具有来源感知的记忆系统,它可以保留执行历史记录,并将其重用与不断发展的任务(例如,迭代跨文件修复)和存储库状态保持一致。 MemTrace 将历史记录存储为锚定到关键信息(例如文件、符号、测试)的不可变记忆跟踪,并在记忆跟踪图中组织它们的执行顺序和依赖关系。当上下文受到限制时,工作中的记忆仅保留紧凑的记忆锚点,智能体可以从中重建最新的执行状态并找到与其下一步操作相关的证据。在恢复历史证据之前,MemTrace 会根据当前存储库状态检查其有效性,并仅检索下一个操作所需的内容。在三个互补的长范围编码基准中,MemTrace 始终优于相同骨干模型和Harness下的所有完全评估的基线,在 Codex CLI 下将 DeepSWE pass@1 提高了 21.2 分,将 SWE-EVO 解决率提高了 4.4 分,将 SWE-Milestone 得分提高了 17.8 分。
