开源项目

Hugging Face TRL:DistillationTrainer升级为稳定接口并重构蒸馏服务链路

huggingface/trl

概述

TRL(Transformers Reinforcement Learning)是Hugging Face开源的基础模型后训练库,基于Transformers生态,支持SFT、GRPO、DPO等技术及多架构、多模态模型,是开源侧微调与对齐的主力工具之一。本次信号聚焦其迭代更新:DistillationTrainer从实验特性转为稳定接口,相关服务链路同步重构,蒸馏调用方式趋于稳定,更适合生产环境依赖;同期README重点新增长上下文训练指南,梳理序列变长后损失、位置、激活值与单卡显存四类问题,并给出在单个8-GPU节点上以百万token序列训练Qwen3-8B的示例。需要蒸馏自有模型或训练超长序列的团队可查阅对应文档与发布页,按稳定接口迁移脚本。