开源项目

OpenRLHF 0.11.2 更新 PPO 训练与评测计算

OpenRLHF/OpenRLHF

模型训练强化学习

概述

OpenRLHF 是语言模型后训练的强化学习框架,负责组织策略更新、奖励计算及分布式执行。 v0.11.2 将 FlashREINFORCE 接入 PPO 配置,并修复 k3 KL 梯度溢出、奖励塑形计算精度及恢复检查点后最佳指标保存的问题。 评测修复包括保留 SFT、DPO 和奖励模型的尾部批次,按样本数加权奖励模型与 DPO 指标;训练侧还修正损失掩码及跨训练轮次的 Token 归一化。已有结果需要结合评测版本进行比较。