开源项目

RL-Kernel:RL后训练的算子级一致性基础设施

RL-Align/RL-Kernel

模型训练强化学习

概述

RL-Kernel是面向RL后训练的高性能基础设施,供做大模型强化学习训练、在意rollout与训练引擎数值一致性的工程师使用。本次以新仓库发布,Apache-2.0协议,提供编译安装与实验复现入口。它为GRPO、PPO等工作负载提供确定性算子与硬件专属内核,使rollout与训练两端的LogP计算保持精确一致,README记录的实验覆盖Qwen3-8B Dense配合vLLM与Megatron-LM的端到端路径,支持NVIDIA SM90与AMD gfx942硬件,Ascend dav_c220为部分算子覆盖。