开源项目

MS-SWIFT v3.12.0:支持GRPO离策略序列掩码并扩展模型适配

MS-SWIFT v3.12.0

模型训练强化学习

概述

MS-SWIFT v3.12.0增加GRPO的Off-Policy Sequence Masking支持,扩展GLM-4.6V及Flash等模型适配,并把GKD截断策略从删除调整为重采样。版本还增加Megatron GRPO的轨迹日志及模型检查,更新NPU LoRA和Qwen Omni微调示例,并包含训练相关修复。升级应按所用训练流程检查配置变化。