开源项目

DaoyuanLi2816/mini-verl:单张消费级GPU上的verl强化学习运行时

DaoyuanLi2816/mini-verl

模型训练强化学习

概述

mini-verl把verl强化学习训练栈带到单张消费级NVIDIA GPU上,支持PPO、GRPO与on-policy蒸馏,可直接复用既有verl配置在本地训练。PyPI上的v0.16.0为稳定版,main分支为开发版;支持Python 3.10至3.13,Apache-2.0许可。经CLI即可完成数据采样与训练,官方示例以长度奖励训练Qwen3-0.6B,如以miniverl run --example hydra-ppo绑定target-length奖励配置运行。