论文

CompactionRL:针对长视野智能体的具有上下文压缩的强化学习

CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

模型训练强化学习

摘要

长视野代理 LLM 越来越受到有限上下文窗口的限制,因为扩展的交互轨迹在任务完成之前可能会超过最大上下文长度。上下文压缩通过总结以前的交互状态并在压缩上下文下继续执行轨迹来提供自然的解决方案,但将压缩合并到强化学习中仍然没有得到充分探索。我们提出了 CompactionRL,这是一种强化学习策略,用于通过上下文压缩来训练长期代理 LLM。我们的方法通过 词元级 损失归一化和跨部门广义优势估计联合优化任务执行和摘要生成。这种设计使 LLM 智能体能够从压缩的长视野轨迹中学习。我们在开放模型之上训练 CompactionRL,并观察到代理编码任务的性能持续提升。 CompactionRL 使开放式 GLM-4.5-Air 模型 (106B-A12B) 在 SWE-bench Verified 上获得 66.4% 的 Pass@1 分数,在 Terminal-Bench 2.0 上获得 26.2% 的 Pass@1 分数,分别比推理时间压缩下的基本模型高出 6.6 分和 4.9 分。 CompactionRL 基于 GLM-4.7-Flash (30B-A3B) 构建,与基本模型相比,Pass@1 提高了 5.5 点和 6.7 点,在 SWE-bench Verified 上达到 56.0%,在 Terminal-Bench 2.0 上达到 20.2%。因此,CompactionRL 被部署在 RL 管道中,用于训练开放的 GLM-5.2 模型 (750B-A40B)。