论文

Nemotron 3 Ultra:用于代理推理的开放、高效的专家混合 Mamba-Transformer 模型

Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

模型架构MoE混合架构

摘要

我们推出了 Nemotron 3 Ultra,这是一个总量为 5500 亿、活跃参数为 550 亿的 Mixture-of-Experts 混合 Mamba-Attention 语言模型。我们在 20 万亿个文本标记上对 Nemotron 3 Ultra 进行预训练,然后将上下文长度扩展到 1M 个标记,并使用监督 微调 (SFT)、强化学习 (RL) 和多教师 同策略 蒸馏 (MOPD) 进行后训练。 Nemotron 3 Ultra 是我们迄今为止最强大的模型,采用了多项关键技术 - LatentMoE、多词元预测 (MTP)、NVFP4 预训练、多环境 RLVR、MOPD 和推理预算控制。与最先进的公开 LLM 相比,Nemotron 3 Ultra 的推理吞吐量提高了约 6 倍,同时达到了同等的精度。最先进的准确性、高推理吞吐量和 1M 词元上下文长度使 Nemotron 3 Ultra 成为长时间运行的自主代理任务的理想选择。我们开源了基础、后训练和量化检查点,以及 HuggingFace 上的训练数据和配方。