开源项目OpenRLHF v0.9.1 重构为 Agent 执行架构并解耦 RL 算法OpenRLHF/OpenRLHFOpenRLHF·来源日期:2026.01.05模型训练强化学习Agentic RL收藏概述OpenRLHF 是面向大模型强化学习训练的开源框架,适用对象为训练与研究团队。本次正式版 v0.9.1 将框架全面重构为 Agent 执行架构,统一 Token 轨迹表示,并将 RL 算法与执行部分解耦,属于训练架构的实质变化。项目以 Apache-2.0 协议开源,由 OpenRLHF 维护,仓库提供训练代码与使用指南。