论文

Molt:用于代理强化学习的可扩展 PyTorch 原生训练框架

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

AI 基础设施分布式训练基础设施

摘要

代理强化学习需要对代理和学习算法进行快速实验,但大型策略和长的多模式轨迹需要大量的分布式基础设施。我们提出 MOLT,一个轻量级的 PyTorch 和 Hugging Face 原生框架,通过四个贡献将这些目标结合在一起。 MOLT 将 Hugging Face 模型的直接加载与经过实验验证的万亿参数可扩展性结合在大约 9.2K 行框架代码中。统一的 OpenAI 和 Anthropic 兼容接口将现有代理与上下文压缩的自动处理集成在一起。完全异步的训练与智能体轨迹采样和策略优化重叠,适应可变的代理执行时间。分布式经验存储消除了长时间多模式轨迹的集中式轨迹采样内存瓶颈。我们在 1 万亿参数策略上实验验证了完整的 RL 训练流程,并展示了使用 30B 专家混合代理的持续学习,将 MOLT 建立为大规模代理 RL 研究的轻量级基础。