开源项目

TRL v1.14.0:DPO/KTO/GRPO 分块流式 log-prob

huggingface/trl v1.14.0

模型训练参数高效训练

概述

TRL 是用于语言模型后训练的开源库,提供偏好优化与强化学习训练器。DPO、KTO、GRPO 是其中的训练方法。 TRL v1.14.0 让 DPO、KTO、GRPO 在各自训练器中以分块方式流式计算 log-prob,复用原有损失逻辑,避免生成完整 logits 或维护两套损失公式。版本还加入合并 log-prob 与熵计算的 Triton 内核,以及 AsyncGRPO 的 LoRA 适配器支持。 原 trl.losses 模块被移除,直接导入 FusedLinearDPOLoss 等类的代码需要迁移。