论文
Mach-Mind-4-Flash 技术报告
Mach-Mind-4-Flash Technical Report
摘要
我们提出了 Mach-Mind-4-Flash,这是一个具有 3B 激活参数的 35B 参数混合专家 (MoE) 代理模型。仅通过 后训练 优化而不扩展 预训练 计算,该模型的性能可达到或超过 100B 参数级模型的性能。通过引入用于大规模强化学习的可扩展代理交互环境,该模型在实际应用任务中获得了显着的性能提升。我们的管道包括三个阶段:(1) 统一的 RL/OPD 训练基础设施,具有动态多教师调度和操作员级加速,可实现 17% 的端到端训练加速; (2) 多个特定领域的 RL 专家在推理、通用和代理轨道上并行训练,然后通过 Multi-Teacher 同策略 蒸馏 (MOPD) 融合成一个通才,这是一个路由反向 KL 目标,消除了混合奖励 RL 的拉锯退化; (3) 混合中值长度策略优化(HMPO),一种单阶段词元效率方法,可将推理链压缩 19--46%,精度损失 0.7 个百分点。 Mach-Mind-4-Flash 在 AIME'26 上得分 92.70,在 IFBench 上得分 82.82,在 Behavioural-SafetyBench 上得分 80.74,在 BFCL-v4 上得分 75.80,在 BrowseComp-zh 上得分 72.31,在 ClawBench 上得分 84.20——领先或匹配其激活大小的 10--30$\times$ 的模型,而其激活大小的一小部分推理成本。