开源项目

astraflow:异步多策略弹性异构rollout的通用LLM强化学习系统

Infini-AI-Lab/astraflow

模型训练强化学习

概述

astraflow是通用LLM强化学习系统,核心特点是异步多策略与弹性异构rollout:采样可按不同策略异步展开,并调度到异构算力上弹性执行,训练与采样解耦。对需要自建RL训练管线的团队,这类设计有助于提升GPU利用率并支撑多任务并行训练。本次公开材料未披露性能数据与支持的算法等更多细节。