论文
AutoCompact:学习何时在长视野编码Agent中压缩上下文
AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents
摘要
编码Agent通过代码检查、搜索、编辑和测试的长轨迹来解决存储库级软件工程任务。随着任务的进展,早期的探索变得过时,因此管理上下文不仅仅是避免溢出:Agent必须决定何时压缩、保留什么工作状态以及如何继续。我们引入了 AutoCompact,它训练编码Agent将这些决策作为其策略的一部分。为了收集训练数据,我们在编码任务上运行基础Agent,并使用评审来审查其压缩决策、摘要和压缩后的操作。在环境中执行之前,有缺陷的输出会被正确的输出替换,因此每个轨迹都从正确的决策继续。我们使用这些轨迹进行监督微调,然后通过强化学习和任务成功奖励联合优化编码和压缩。 SWE-bench Verified 和 SWE-PolyBench Verified 上的实验表明,AutoCompact 相对于基本模型,通过率分别提高了 9.2% 和 5.0%。这些改进适用于所有评估的推理预算,其中 256K 上下文窗口永远不会溢出,16K 窗口溢出会触发后备压缩。
