论文

ReFold:长任务 Agent 的可逆轮间上下文折叠

ReFold: Training-Free Reversible Inter-Turn Context Folding for Long-Horizon Agents

上下文与知识上下文工程

摘要

长程LLM Agent使用只追加交互历史,每步重发给模型,使上下文和成本增长直至超窗。现有方法以额外模型调用、启发规则或训练策略预测上下文需求,但增加运行开销、破坏前缀缓存,并永久删除无法保证恢复的内容。ReFold是免训练呈现层:保留底层历史,只压缩模型看到的上下文。无需辅助预测器,移除两类轮间冗余:此前已显示的内容用占位记录代替;Agent自己报告完成的轮次折为一行笔记。两算子采用分块呈现,每隔数步而非每步改写缓存前缀。所有移除严格可逆,误删只需从历史恢复一次而非永久丢失。它可即插即用到标准ReAct Harness。在五个长程基准与两个前沿LLM上,词元消耗最多缩减2.5倍,每会话KV内存减半且不降低任务成功率。有上下文上限时,最多避免92%强制压缩;并发服务时,排队延迟最多减少100%,推理最多加速1.7倍,费用最多缩减3.4倍。

ReFold:长任务 Agent 的可逆轮间上下文折叠:论文原图
图2:16k预算下,相同50项SWE-bench Verified任务的六种策略。每会话KV占用与峰值组成(a,b),每任务费用、时长及解决率(c,d),一条轨迹的前缀缓存复用(e),以及被驱逐观测词元的后续去向(f)。