论文

自压缩语言模型代理

Self-Compacting Language Model Agents

上下文与知识上下文工程

摘要

由思想链和工具调用组成的长代理跟踪会积累锚定后代的陈旧内容,并最终超出上下文窗口。现有的脚手架通过在词元阈值触发的固定间隔压缩来缓解这一问题。此类触发器不关心轨迹结构,存在在推导或搜索过程中丢弃部分结果的风险。我们提出了 SelfCompact,一个允许模型本身决定何时以及如何压缩的支架。具体来说,它将两个推理时间元素配对:(i)模型调用的压缩工具来总结累积的上下文,以及(ii)指定何时触发(子任务已解决,或轨迹正在收敛)以及何时抑制(中间推导或卡住时)的轻量级规则。两者都需要。仅该工具在开放权重模型中的使用并不均衡,通常在无用的时刻调用或根本不调用;仅靠这个标题是无法发挥作用的。它们共同引发有效的自适应压实,无需任何 微调 或外部监督。我们展示了六个基准(竞争性数学和代理搜索)和七个模型的实证结果。我们的结果表明,SelfCompact 以一小部分词元成本匹配或超过固定间隔摘要,在数学方面比无摘要基线提高了 18.1 分,在代理搜索方面提高了 5-9 分,每个问题的成本降低了 30-70%。我们的结果暴露了一个元认知差距:尽管无提示的模型无法可靠地判断它们自己的上下文何时正在腐烂,但轻量级的标题弥补了这一差距,将何时压缩重新定义为脚手架无需训练即可提供的功能。