论文
ARLArena:稳定 Agentic 强化学习的统一框架
ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning
摘要
Agentic 强化学习(ARL)作为训练智能体解决复杂多步交互任务的有前景范式迅速受到关注。尽管早期结果令人鼓舞,ARL 仍然高度不稳定,常导致训练崩溃。这种不稳定性限制了向更大环境和更长交互时域的扩展,也约束了对算法设计选择的系统性探索。本文首先提出 ARLArena,一个稳定的训练配方与系统性分析框架,在受控、可复现的设定下考察训练稳定性。ARLArena 首先构建一个干净、标准化的测试床。然后,我们将策略梯度分解为四个核心设计维度,并评估每个维度的性能与稳定性。通过这一细粒度分析,我们提炼出对 ARL 的统一视角,并提出 SAMPO,一个旨在缓解 ARL 主要不稳定来源的稳定 Agentic 策略优化方法。实证上,SAMPO 在多样化 Agentic 任务上实现持续稳定的训练与强劲表现。总体而言,本研究为 ARL 提供了统一的策略梯度视角,并为构建稳定、可复现的基于 LLM 的智能体训练管线提供实践指导。
