开源项目
TRL v1.14.0:DPO/KTO/GRPO 分块流式 log-prob
huggingface/trl v1.14.0
概述
TRL 是用于语言模型后训练的开源库,提供偏好优化与强化学习训练器。DPO、KTO、GRPO 是其中的训练方法。 TRL v1.14.0 让 DPO、KTO、GRPO 在各自训练器中以分块方式流式计算 log-prob,复用原有损失逻辑,避免生成完整 logits 或维护两套损失公式。版本还加入合并 log-prob 与熵计算的 Triton 内核,以及 AsyncGRPO 的 LoRA 适配器支持。 原 trl.losses 模块被移除,直接导入 FusedLinearDPOLoss 等类的代码需要迁移。