开源项目

JustGRPO:扩散语言模型GRPO训练开源

LeapLabTHU/JustGRPO

模型训练强化学习RLVR

概述

JustGRPO 是扩散语言模型 AR 顺序 GRPO 训练方法的官方实现,研究任意顺序在扩散语言模型中的价值,README 标注论文获 ICML 2026 杰出论文奖。工程明确于2026年1月发布 GSM8K 训练与评测代码,提供安装和训练命令,以 MIT 许可发布,具备独立方法与复现价值。