论文

MinT:用于训练和服务数百万 LLM 的托管基础​​设施

MinT: Managed Infrastructure for Training and Serving Millions of LLMs

AI 基础设施推理服务

摘要

我们推出 MindLab Toolkit (MinT),这是一个用于低秩适应 (LoRA) 后训练 和在线服务的托管基础​​设施系统。 MinT 的目标是通过少量昂贵的基础模型部署生成许多训练有素的策略。 MinT 没有将每个策略具体化为合并的完整检查点,而是保持基本模型驻留,并通过部署、更新、导出、评估、服务和回滚移动导出的 LoRA 适配器修订版,将分布式训练、服务、调度和数据移动隐藏在服务接口后面。 MinT 沿三个轴缩放该路径。 Scale Up 将 LoRA RL 扩展到前沿规模的密集和 MoE 架构,包括 MLA 和 DSA 注意力路径,训练和服务验证超过 1T 总参数。缩小仅移动导出的 LoRA 适配器,在 1 级设置中该适配器可以小于基本模型大小的 1%;仅适配器切换在 4B 密集模型上将测量步骤减少了 18.3 倍,在 30B MoE 上减少了 2.85 倍,而并发多策略 GRPO 在不提高峰值内存的情况下将挂墙时间缩短了 1.77 倍和 1.45 倍。横向扩展将持久策略可寻址性与 CPU/GPU 工作集分开:张量并行部署支持 10^6 规模的可寻址目录(测量单引擎扫描 100K)和集群规模的千个适配器活动波,冷加载被视为计划服务工作,打包的 MoE LoRA 张量将实时引擎负载提高 8.5-8.7 倍。因此,MinT 可以管理百万级 LoRA 策略目录,同时通过共享 1T 级基础模型训练和服务选定的适配器修订版。