论文

Nemotron-Labs-3-Puzzle-75B-A9B:混合MoE大模型压缩

Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs

模型优化模型架构模型训练MoE强化学习模型压缩Agentic RL

摘要

我们提出Nemotron-Labs-3-Puzzle-75B-A9B,为交互式部署优化的Nemotron-3-Super压缩变体。设计目标是在高用户并发约束下最大化服务器吞吐。在单节点8×B200的交互式serving负载下,Puzzle-75B-A9B在匹配用户吞吐约束下取得约为Nemotron-3-Super两倍的服务器吞吐;在单张H100的超长上下文部署中,把100万token并发从1个请求提升到8个。模型经多阶段管线构建:结合迭代Puzzle压缩框架与知识蒸馏、强化学习、量化及多token预测头;压缩过程联合优化异构MoE剪枝、激活参数预算与Mamba剪枝。跨推理、编码、多语言、长上下文与智能体基准的广泛评估显示:尽管大幅压缩,模型相对父模型在广泛任务上保持强下游准确率。权重已在Hugging Face公开。

Nemotron-Labs-3-Puzzle-75B-A9B:混合MoE大模型压缩:论文配图
图 4:Puzzle-75B-A9B 的训练进度。在使用短上下文 KD 的最终 Puzzle 迭代后,准确率急剧恢复,而长上下文 KD 有选择地提高长上下文能力。 RL 的影响很小。在整个训练阶段,冗长程度逐渐提高。