开源项目

Dynamo发布MiniMax M3分布式vLLM部署实验快照

Dynamo v1.6.0-minimax-m3-dev.1

模型推理KV Cache投机采样分布式推理

概述

NVIDIA Dynamo用于组织大模型的分布式推理服务。本次v1.6.0-minimax-m3-dev.1是面向MiniMax-M3-NVFP4的实验快照,提供CUDA 13 vLLM容器、推理及结构化输出解析器、GB200视觉patch embedding和EAGLE/MTP KV卸载修复。镜像不包含vLLM-Omni。 Kubernetes配方固定目标及EAGLE3草稿检查点,使用TP4、FP8 KV、一百万token上下文和KV感知路由。聚合配置共12张GB200,每副本400GB CPU KV卸载;分离配置共24卡,通过NIXL传输prefill与decode间KV。部署需要Dynamo Platform、ComputeDomain、NVIDIA DRA及模型下载权限。官方明确这是未经过QA门禁的实验版本,API、默认行为和运行结果可能变化,适用于评估和反馈,不建议用于生产。