开源项目
TRL 1.14.2 修复多 EOS 生成边界与在线训练错配
v1.14.2
概述
TRL 是面向语言模型后训练的开源框架。1.14.2 修复模型存在多个 EOS token 时、部分非 vLLM 生成路径未正确停止的问题,影响 GRPO、RLOO 和在线蒸馏;错误情况下,模型可能继续生成直到长度上限,额外内容进入训练。此次还修正提示与补全文本边界偏离、vLLM 路径指标和完成样本遮罩等问题,并包含 DFT 与 FSDP 相关修正。使用者应按本次 tag 升级,检查自己使用的生成后端、停止 token 和样本保留规则;这些是训练正确性修复,不代表新训练算法或无条件性能提升。