论文
StateTape:长视野编码Agent的行动条件证据生命周期建模
StateTape: Action-Conditioned Evidence Lifecycle Modeling for Long-Horizon Coding Agents
摘要
尽管基于大语言模型的编码Agent最近取得了成功,但长期运行它们仍然具有挑战性,因为每一次观察都附加到上下文中,并且上下文随着每次观察而增长。基于历史的维护是一种常见的补救措施,它掩盖或总结旧的观察结果,或者修剪模型认为无用的内容,并以很小的成本限制上下文。然而,它仅根据历史文本来决定,而看不到代码是如何连接的。由于编码Agent在单个任务中多次编辑代码,并且每次写入都可能更改其他地方代码的含义,因此此类维护可能会保留写入伪造的记录,删除仍然保留的记录,并错过Agent接下来需要的代码。为了克服这些挑战,本文提出了 StateTape,这是一种新颖且可扩展的框架,可以随着存储库的变化而不是随着上下文的增长而重写编码Agent的上下文。 StateTape 的关键思想是将存储库建模为符号级代码图,其依赖关系和语言规则公开了写入可以影响哪些符号。在此图表上,磁带标记了每次写入更改的符号,这将陈旧性从对文本的推断转变为对Agent写入的观察。我们提出了一种每次写入程序,其中磁带指定写入可能伪造的记录,同时小型管理器模型解决写入日志无法解决的问题,并进一步提供理论分析和 TraceBench,这是一个基准,用于标记Agent持有的内容与实际需要的内容。根据经验,我们证明 StateTape 可以有效地清除伪造记录并检索所需内容,从而在六个编码Agent和三个大量编辑基准测试的所有实验中实现更高的解析率,而计算开销很小。