开源项目

TRL:Hugging Face开源的强化学习后训练库

huggingface/trl

模型训练监督微调与指令调优

概述

TRL是Hugging Face面向SFT、RLHF等后训练场景的开源训练库。本次正式版的关键改动在SFT损失计算:训练过程不再构造并保留完整logits张量,避免这部分随词表规模与序列长度增长的显存开销,显著降低训练显存占用。对在大词表模型或长序列上做监督微调的团队,相同显存下可以放大批次或序列长度,减少为省显存而做的速度折衷。更新详情见GitHub仓库。