论文

Sol-H3:跨云和边缘的 Sol-Engine 上 MiniMax-H3 推理加速的递归自我改进

Sol-H3: Recursive Self-Improvement for MiniMax-H3 Inference Acceleration on Sol-Engine across Cloud and Edge

模型推理推理加速

摘要

视频扩散模型正在快速扩展并展现出增强的生成能力。在这些最新进展中,MiniMax-H3 作为一款功能强大的生产级开源模型脱颖而出。然而,其 330 亿个参数和多步迭代去噪过程带来了大量的计算开销。因此,它们的实际生产受到 NVIDIA-GB200 等云部署中的生成延迟的阻碍,同时严格的内存限制也给 DGX-Spark 等边缘设备带来了进一步的挑战。为了解决从云到边缘设备的这些不同的硬件瓶颈,我们提出了一个全栈推理管道,它将高效的算法设计与优化的算子实现集成在一起。在算法上,我们引入了一种跨分辨率的两阶段生成调度器,它利用了扩散的逐步性质:早期的低分辨率步骤快速建立全局布局,而后来的高分辨率步骤则集中于局部和感知细节的细化。这些阶段通过学习的潜在到潜在映射模块连接,完全消除了跨不同分辨率传输分辨率时计算成本高昂的 VAE 解码-重新编码周期。对于算子实现,我们部署了一个递归自我改进(RSI)循环来搜索内核融合和内存布局,评估延迟和数值一致性。这些优化共同实现了高达 30 倍的端到端加速和 20% 的内存降低:在 8xGB200 节点上生成 5 秒的 1344x768 音频视频的速度比实时速度快 3.5 倍,并且在单个 DGX Spark 上在一分钟内完全驻留在内存中。