论文

智能体何时能遗忘自己的推理?面向长程Agent上下文压缩的ICLR

When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression

上下文与知识上下文工程

摘要

长程语言模型智能体不断累积推理历史,即使早期决策已经执行并观测,上下文长度和推理成本仍持续增长。与静态思维链压缩不同,删除历史推理可能改变未来动作及由此产生的交互轨迹。我们研究何时可以安全遗忘此类推理。我们提出ICLR(面向长程推理的交互感知压缩),一种免训练的在线方法,使用冻结代理熵对推理块排序,同时保留动作、工具调用和观察。在260个WorkBuddyBench任务上,ICLR将平均奖励从0.699提升到0.718,同时把输入、输出和缓存读取token分别减少25.5%、14.4%和33.3%。消融揭示了轨迹放大效应:局部删除推理会通过改变后续交互而产生总计算的非线性变化。表示探针、激活修补和受控轨迹分析进一步表明,一旦任务相关的派生状态被可靠外化到代码、文件、工具输出或环境反馈中,历史推理就变得更可替代。这些结果把智能体推理刻画为动态工作状态,而非永久的交互历史。

智能体何时能遗忘自己的推理?面向长程Agent上下文压缩的ICLR:论文配图
图 2:ICLR 概览。在每个完成的智能体步骤中,新生成的推理被划分为若干块,而动作、工具调用和观察则被保留。冻结的代理打分器为每个块估计 token 级预测熵。低熵块在压缩历史写回以供下一次智能体请求使用之前被移除。