论文
通过观测上下文压缩实现高效终端代理的自我进化框架
A Self-Evolving Framework for Efficient Terminal Agents via Observational Context Compression
摘要
随着终端代理扩展到长视野、多轮工作流程,关键瓶颈不仅是有限的上下文长度,而且是交互历史中嘈杂的终端观察的积累。保留原始观察结果可以保留有用的环境反馈,但也会导致上下文饱和和高词元成本;相反,朴素压缩可能会丢弃后续操作所需的任务关键信号。由于终端环境在存储库、命令和执行状态之间高度异构,因此基于启发式或固定提示的压缩方法很难推广。我们提出 TACO,一个即插即用的 无需训练,用于现有终端代理的自我进化终端代理压缩框架。 TACO 自动发现、细化和重用交互轨迹中的结构化压缩规则,从而实现低价值终端输出的工作流自适应过滤,同时保留与任务相关的观察结果。 TerminalBench(TB 1.0 和 TB 2.0)以及其他四个与终端相关的基准测试(包括 SWE-Bench Lite、CompileBench、DevEval 和 CRUST-Bench)上的实验表明,TACO 持续改进代理支架和骨干模型的任务性能和词元效率。在 TerminalBench 上,TACO 在强代理模型上的准确率提高了 1%-4%,在相同的 词元预算 下准确率提高了约 2%-3%。在其他与终端相关的基准测试中,它减少了总词元消耗,同时保持或提高了任务成功率。这些结果表明,自我进化、工作流程自适应的观察压缩是实现更可靠、更高效的长视野终端代理的有效途径。该代码可在 https://github.com/multimodal-art-projection/TACO 上公开获取。