开源项目astraflow:异步多策略弹性异构rollout的通用LLM强化学习系统Infini-AI-Lab/astraflowInfini-AI-Lab·来源日期:2026.05.13模型训练强化学习收藏概述astraflow是通用LLM强化学习系统,核心特点是异步多策略与弹性异构rollout:采样可按不同策略异步展开,并调度到异构算力上弹性执行,训练与采样解耦。对需要自建RL训练管线的团队,这类设计有助于提升GPU利用率并支撑多任务并行训练。本次公开材料未披露性能数据与支持的算法等更多细节。