论文

Relax 以全模态原生及服务解耦支持异步强化学习

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

模型训练模型架构模型推理AI 基础设施应用与实践MoE强化学习批处理与并行分布式训练基础设施视觉感知与空间理解Agentic RL

摘要

强化学习后训练已被证明能提升大语言模型的推理、自我反思和工具使用能力。当模型扩展至全模态输入及Agent多轮工作流时,训练系统面临相互关联的三个难题:异构数据流、大规模运行的稳健性,以及策略陈旧程度与吞吐量的权衡。我们提出开源强化学习训练引擎Relax,通过协同设计的三层架构解决这些问题。首先,全模态原生架构从数据预处理、模态感知并行到推理生成,在全栈支持多模态,而非改造以文本为中心的流程。其次,每个强化学习角色作为独立、故障隔离的服务运行,可无需全局协调地扩容、恢复和升级。第三,服务级解耦通过TransferQueue数据总线支持异步训练,单一策略陈旧参数即可在同策略、近同策略及完全异步执行之间连续调节。在Qwen3-4B同策略训练上,Relax相对veRL获得1.20倍端到端加速;完全异步模式相对同置部署,在Qwen3-4B上加速1.76倍,在Qwen3-Omni-30B上加速2.00倍,所有模式均收敛至相同奖励水平。对MoE模型,Relax支持R3(Rollout Routing Replay),额外开销仅1.9%,相同配置下veRL性能下降32%。在Qwen3-Omni的图像、文本和音频任务上,它实现稳定全模态强化学习收敛;视频训练超过2,000步仍未退化。项目地址为https://github.com/rednote-ai/Relax。