论文

ACLArena:多阶段后训练中的Agent持续学习

ACLArena: Agent Continue Learning in Multi-stage Post-training

模型训练强化学习持续学习Agentic RL

摘要

构建面向工业部署的通用智能体需要整合多种能力,而每种能力通常在训练的不同阶段获得。然而目前尚无公认的智能体持续学习(ACL)配方,对现有整合范式之间取舍的理解也很少。为填补这一空白,我们提出 ACLArena,一个用于全面研究、分析和评估 ACL 的框架。我们首先构建顺序训练管线,并从模型层和 token 层两个互补视角深入分析遗忘与泛化的机制。在这些分析指导下,我们系统比较多教师在线策略蒸馏、自蒸馏微调和模型合并,评估它们在保留新获能力的同时恢复已学能力的表现。通过大量实验,我们对能力如何跨阶段迁移建立了细致理解。最后,我们提出新的 ACL 配方:在高质量轨迹上离线回放,结合多个经 RL 专门化并由路由网络组织的 LoRA 专家,显著提升智能体跨多个领域的学习能力。在四个推理与智能体任务上的全面实验(域内和域外设置)验证了我们分析的价值与方法的有效性。

ACLArena:多阶段后训练中的Agent持续学习:论文配图
图 1:能力巩固的四种主流范式概览:顺序训练、多教师混合在线策略蒸馏(MMOPD)、自蒸馏微调(SDFT)以及模型合并(MM)。