开源项目

TRL:v0.27.0新增异步奖励与GDPO

huggingface/trl

模型训练强化学习

概述

huggingface/trl 是 Hugging Face 维护的开源强化学习训练库,供开发者对大模型做后训练与对齐。本次 v0.27.0 正式版改变多奖励强化学习优化及奖励执行机制,新增异步并行奖励、GDPO 与序列离策略掩码,变化超出普通适配修复。工程提供安装示例,以 Apache-2.0 许可发布。