开源项目JustGRPO:扩散语言模型GRPO训练开源LeapLabTHU/JustGRPOLeapLabTHU·来源日期:2026.01.12模型训练强化学习RLVR收藏概述JustGRPO 是扩散语言模型 AR 顺序 GRPO 训练方法的官方实现,研究任意顺序在扩散语言模型中的价值,README 标注论文获 ICML 2026 杰出论文奖。工程明确于2026年1月发布 GSM8K 训练与评测代码,提供安装和训练命令,以 MIT 许可发布,具备独立方法与复现价值。