论文
Nemotron-Labs-3-Puzzle-75B-A9B:混合MoE大模型压缩
Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs
摘要
我们提出Nemotron-Labs-3-Puzzle-75B-A9B,为交互式部署优化的Nemotron-3-Super压缩变体。设计目标是在高用户并发约束下最大化服务器吞吐。在单节点8×B200的交互式serving负载下,Puzzle-75B-A9B在匹配用户吞吐约束下取得约为Nemotron-3-Super两倍的服务器吞吐;在单张H100的超长上下文部署中,把100万token并发从1个请求提升到8个。模型经多阶段管线构建:结合迭代Puzzle压缩框架与知识蒸馏、强化学习、量化及多token预测头;压缩过程联合优化异构MoE剪枝、激活参数预算与Mamba剪枝。跨推理、编码、多语言、长上下文与智能体基准的广泛评估显示:尽管大幅压缩,模型相对父模型在广泛任务上保持强下游准确率。权重已在Hugging Face公开。
