论文
ProRL Agent:面向多轮LLM智能体强化学习训练的Rollout即服务
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
摘要
多轮LLM智能体在解决复杂交互任务中日益重要,而强化学习(RL)是改进其长时程行为的关键要素。然而,RL训练需要生成大量沙箱化的rollout轨迹,现有基础设施常将rollout编排与训练循环耦合在一起,导致系统难以迁移和维护。秉持rollout即服务(rollout-as-a-service)理念,我们提出ProRL Agent,这是一个通过API服务承载智能体rollout全生命周期的可扩展基础设施。ProRL Agent还提供标准化、可扩展的沙箱环境,在无root权限的HPC环境中支持多样的智能体任务。我们通过在软件工程、数学、STEM和编码任务上的RL训练验证ProRL Agent。ProRL Agent已开源,并作为NVIDIA NeMo Gym的组成部分集成。
