论文
ZipRL:结合事后响应回放的自适应多轮上下文压缩
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
摘要
自适应上下文压缩对将大语言模型(LLM)扩展到复杂多轮智能体任务至关重要。然而,基于规则的压缩方法可能丢弃任务关键细节,而强化学习(RL)方法通常难以在长程工作流固有的稀疏奖励下平衡信息保留与token效率。为弥合这一差距,我们提出ZipRL,一个为可验证奖励强化学习(RLVR)量身定制的新型自适应压缩框架。ZipRL的特点是多粒度压缩机制,实现主动的、非均匀的信息削减,并辅以事后响应回放(HRR),一项为在RLVR优化期间加密训练信号而设计的技术。理论上,我们证明ZipRL在任务相关效用上优于均匀压缩方法。具体而言,ZipRL利用由粗到细的提示进行宏观压缩,并通过广义优势重塑将HRR融入GRPO。多个不同版本与参数规模的模型验证了我们方法的有效性。在五项智能体任务上的基准测试显示,ZipRL在Qwen3-4B与Qwen3-8B上分别以27.9%与34.7%超越最先进方法,同时在极端的256轮外推压力测试下保持出色的token效率与鲁棒性。
