开源项目MS-SWIFT v3.12.0:支持GRPO离策略序列掩码并扩展模型适配MS-SWIFT v3.12.0modelscope·来源日期:2025.12.30模型训练强化学习收藏概述MS-SWIFT v3.12.0增加GRPO的Off-Policy Sequence Masking支持,扩展GLM-4.6V及Flash等模型适配,并把GKD截断策略从删除调整为重采样。版本还增加Megatron GRPO的轨迹日志及模型检查,更新NPU LoRA和Qwen Omni微调示例,并包含训练相关修复。升级应按所用训练流程检查配置变化。