论文
StateComp:学习长时程Agent何时压缩历史
StateComp: Learning When to Compress History in Long Horizon Agents
摘要
长时程Agent在任务执行中不断累积交互历史,而过去交互的重要性会随Agent状态的演化而变化。现有上下文管理方法大多基于固定窗口、周期性调度或当前相关性来压缩历史,忽视了一个更根本的问题:一段过去的交互何时才可被安全替换?过早压缩可能删除未来动作仍需要的信息,而过度保守的保留会带来可观的上下文开销。为此,我们提出State Conditioned Compression(StateComp),一个根据当前Agent状态判断历史交互何时可被安全压缩的框架。StateComp通过两阶段标注流程构建KEEP与READY监督信号,并在冻结语言模型的隐藏表示上训练一个不平衡感知的路由器。有界状态表示进一步降低了评估长历史的成本,相邻的READY交互则被分组为连续片段,并在执行过程中以紧凑摘要替换。在WorkBuddyBench上的实验表明,StateComp在保持任务性能的同时,将Agent与摘要的总token用量降低52.27%,并将表示提取速度提升12.67倍。
