论文

Star Elastic:具有高效预算控制的多合一推理 LLM

Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

模型优化小模型/轻量模型

摘要

无论是从头开始还是通过迭代压缩来训练 大语言模型 (LLM) 系列,都非常昂贵且效率低下,需要为系列中的每个模型单独运行训练。在本文中,我们介绍了 Star Elastic,这是一种新颖的 LLM 后训练 方法,该方法通过单个 后训练 作业使用一次运行的计算(N 倍节省)将 N 个嵌套子模型添加到给定的父推理模型。除了降低训练成本之外,Star Elastic 还解决了高效推理的一个基本限制:静态架构的刚性,无论词元难度如何,都会强制分配恒定的资源。通过解锁弹性预算控制,Star Elastic 实现了一种新颖的推理方案,该方案在每个推理阶段(思考和回答)使用不同的子模型。 Star Elastic 支持 (1) 沿 SSM、嵌入通道、MoE 和 FFN 轴嵌套,(2) 通过端到端可训练路由器学习嵌套子模型,以及 (3) 基于课程的 知识蒸馏。在 Nemotron Elastic 框架的基础上,我们将 Star Elastic 应用于 NVIDIA Nemotron Nano 模型,特别关注混合专家混合 (MoE) 架构:从 Nemotron Nano v3 (30B/3.6A) 开始,我们生成具有 160B 训练词元的 23B (2.8A) 和 12B (2.0A) 变体。所有嵌套模型都匹配或优于同等大小的独立训练基线,并且与从头开始的预训练相比,实现了 360 倍的缩减,与最先进的压缩相比,实现了 7 倍的缩减。至关重要的是,弹性预算控制推进了准确性-延迟帕累托前沿,通过动态每相模型选择实现了高达 16% 的准确性提升和 1.9 倍的延迟降低。我们通过量化感知 蒸馏 (QAD) 将 Star Elastic 进一步扩展到量化机制,生成嵌套的 NVFP4 和 FP8 弹性检查点,保留零样本切片,同时提供更小的部署占用空间。