开源项目

Hugging Face TRL发布v1.8:调整GRPO/RLOO数据流程并扩展环境奖励

huggingface/trl

模型训练强化学习

概述

TRL是Hugging Face的Transformer强化学习训练库,覆盖SFT、DPO、GRPO等主流后训练方法,是开源社区常用的LLM对齐训练工具。本次v1.8版本(2026-07-22)改变GRPO与RLOO训练的数据工作流,并扩展环境奖励机制,支持更多来自外部环境的奖励信号。使用这两类算法做后训练的团队升级时需要适配数据处理改动,环境奖励新接口建议先在小规模实验中验证效果与稳定性。