论文

Nemotron 3 Super:面向Agent推理的开放MoE混合Mamba—Transformer模型

Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

摘要

我们介绍Nemotron 3 Super的预训练、后训练与量化。模型为1200亿总参数、120亿激活参数的Mamba—注意力混合MoE,是Nemotron 3系列中首个采用NVFP4预训练、使用同时优化每FLOP和每参数准确率的LatentMoE、并加入MTP层以原生推测解码加速推理的模型。模型先以25万亿词元预训练,再使用监督微调和强化学习进行后训练。最终支持最长100万词元上下文,在常见基准上达到可比准确率,且相对GPT-OSS-120B与Qwen3.5-122B,推理吞吐最高分别提升2.2倍和7.5倍。数据集及基础、后训练、量化检查点均在HuggingFace开放。