论文

ARLArena:稳定 Agentic 强化学习的统一框架

ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

模型训练强化学习Agentic RL

摘要

Agentic 强化学习(ARL)作为训练智能体解决复杂多步交互任务的有前景范式迅速受到关注。尽管早期结果令人鼓舞,ARL 仍然高度不稳定,常导致训练崩溃。这种不稳定性限制了向更大环境和更长交互时域的扩展,也约束了对算法设计选择的系统性探索。本文首先提出 ARLArena,一个稳定的训练配方与系统性分析框架,在受控、可复现的设定下考察训练稳定性。ARLArena 首先构建一个干净、标准化的测试床。然后,我们将策略梯度分解为四个核心设计维度,并评估每个维度的性能与稳定性。通过这一细粒度分析,我们提炼出对 ARL 的统一视角,并提出 SAMPO,一个旨在缓解 ARL 主要不稳定来源的稳定 Agentic 策略优化方法。实证上,SAMPO 在多样化 Agentic 任务上实现持续稳定的训练与强劲表现。总体而言,本研究为 ARL 提供了统一的策略梯度视角,并为构建稳定、可复现的基于 LLM 的智能体训练管线提供实践指导。

ARLArena:稳定 Agentic 强化学习的统一框架
图1: ARLArena 概览。第 1 部分:通过行为克隆、格式惩罚、KL 正则化与超参数搜索实现的标准化测试平台。第 2 部分:将策略梯度分解为四个维度,并将代表性方法映射到各维度。第 3 部分:关于训练稳定性与坍塌模式的关键发现。第 4 部分:将洞见统一整合到 SAMPO 中,以实现稳定的 ARL 训练。