论文

AgentJet:面向智能体强化学习的分布式集群训练框架

AgentJet: A Distributed Swarm Training Framework for Agentic Reinforcement Learning

AI 基础设施模型训练智能体系统强化学习Agent HarnessAI 开发与运维平台Agentic RL

摘要

训练大型语言模型 (LLM) 代理的强化学习 (RL) 策略需要优化与外部环境交互的多轮轨迹。现有的训练框架面临运行时故障、单一模型约束、不兼容的任务环境和冗余上下文等问题。我们提出了 AgentJet,一个基于解耦多节点架构的分布式群训练框架。 AgentJet 将服务器-客户端拓扑视为可配置的:Swarm 服务器托管可训练模型并在 GPU 集群上执行优化,而可拆卸的 Swarm 客户端执行任意代理并通过 OpenAI 兼容的 API 进行通信。重新配置此拓扑可支持异构多模型 RL、具有隔离运行时的混合任务训练、容错执行以及通过热插拔客户端进行实时代码迭代。 AgentJet 还引入了具有时间线合并功能的上下文跟踪,将 AppWorld 上的参与者更新时间缩短了 6.25 倍。同样的可拆卸客户端设计支持自动化研究系统,该系统可以在有限的人为干预下对大规模集群进行长期、多天的强化学习研究。 AgentJet 是开源的,并且与发出标准 LLM 推理请求的代理系统兼容。

AgentJet:面向智能体强化学习的分布式集群训练框架:论文配图
图 1:AgentJet 群训练架构。 Swarm 服务器(优化器节点)在 GPU 集群上托管模型权重,而 Swarm 客户端(采样节点)执行代理工作流程并收集强化学习训练轨迹。集群网络随着客户端的加入和离开而动态形成,从而实现容错操作、热插拔调试和多模型训练。