论文

Jupiter-N 技术报告

Jupiter-N Technical Report

模型训练持续学习

摘要

我们推出了 Jupiter-N,这是一种经过 Nemotron 3 Super 后训练的混合推理模型,Nemotron 3 Super 是一个完全开源的 1200 亿参数 LLM。我们的目标是三个目标:(1)通过不确定性策划的轨迹实现代理能力; (2) 通过基于文化规范的综合数据实现英国文化一致性; (3) 通过并行语料库和 LLM 翻译的威尔士语对话提供威尔士语支持。我们的数据管理策略小心地保留了基本模型的功能:使用我们的勿忘我框架,我们将 同策略 合成重放与 离策略 任务数据混合在一起,以减轻灾难性遗忘,并包含推理和非推理痕迹的混合,以保持 Nemotron 的混合推理能力。 Jupiter-N 在威尔士语方面比 Nemotron 取得了显着的进步(在 ARC-Easy 上+18,在 MMLU-Lite 上+5.25)、终端使用(在 Terminal Bench 2 上+9.1)和指令遵循(在 IFBench 上+4.4),同时保留了基本模型功能。我们将这项工作构建为主权 后训练 的可复制模板:替换文化知识、机构语料库和目标语言,为任何国家产生等效的管道。所有模型权重和所有 后训练 数据集均根据开放许可证公开发布。