论文

StateComp:学习长时程Agent何时压缩历史

StateComp: Learning When to Compress History in Long Horizon Agents

上下文与知识上下文工程

摘要

长时程Agent在任务执行中不断累积交互历史,而过去交互的重要性会随Agent状态的演化而变化。现有上下文管理方法大多基于固定窗口、周期性调度或当前相关性来压缩历史,忽视了一个更根本的问题:一段过去的交互何时才可被安全替换?过早压缩可能删除未来动作仍需要的信息,而过度保守的保留会带来可观的上下文开销。为此,我们提出State Conditioned Compression(StateComp),一个根据当前Agent状态判断历史交互何时可被安全压缩的框架。StateComp通过两阶段标注流程构建KEEP与READY监督信号,并在冻结语言模型的隐藏表示上训练一个不平衡感知的路由器。有界状态表示进一步降低了评估长历史的成本,相邻的READY交互则被分组为连续片段,并在执行过程中以紧凑摘要替换。在WorkBuddyBench上的实验表明,StateComp在保持任务性能的同时,将Agent与摘要的总token用量降低52.27%,并将表示提取速度提升12.67倍。

StateComp:学习长时程Agent何时压缩历史:论文配图
图 1:StateComp 概览。结构化标注与第二轮边界审查共同产生监督信号。路由器从冻结表示模型的隐藏状态中学习。在线预测先与片段长度及 token 门控结合,然后摘要才替换原始交互。历史与当前状态特征被联合使用,详见第 4.1 节。