论文

AstraFlow:Agentic LLM 的面向数据流的强化学习

AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

AI 基础设施分布式训练基础设施

摘要

强化学习 (RL) 越来越多地用于提高 大语言模型 的推理、编码和工具使用能力,但代理 RL 的成本仍然过高。将 RL 扩展到代理 LLM 需要支持复杂的工作负载,包括多策略协作训练,同时有效地使用弹性、异构和跨区域的计算资源。现有的 LLM RL 系统支持其中一些功能,但每个新的扩展通常需要专门的系统工程。这种负担源于以训练者为中心的控制架构以及强化学习系统组件缺乏原则抽象。为了解决这些限制,我们提出了 AstraFlow,这是一种面向数据流的 RL 系统,它用原则性的组件抽象取代了传统的以训练者为中心的控制。在 AstraFlow 中,采样轨迹服务、数据流管理和训练被解耦为自治组件,使系统能够原生支持复杂的多策略代理 RL 工作负载并有效利用不同的计算资源。我们跨数学、代码、搜索和 AgentBench 工作负载评估 AstraFlow,结果表明同一系统支持多策略训练、弹性扩展、异构跨区域执行和可组合数据算法,而无需更改系统级代码。在多策略协作训练中,AstraFlow 实现了与现有 RL 系统相当或更好的精度,同时将训练时间缩短了 2.7 倍。