论文
MCAP:内存受限的 LLM 推理的部署时间层分析
MCAP: Deployment-Time Layer Profiling for Memory-Constrained LLM Inference
摘要
将 大语言模型 部署到异构硬件通常受到内存而非计算的限制。我们引入了 MCAP(蒙特卡罗激活分析),这是一种加载时间每层重要性估计器,可在目标设备上实现动态精度和内存布局决策。 MCAP 产生轻量级的每层信号,驱动精确调度(W4A8 与 W4A16)和驻留层(GPU、RAM、SSD),从而允许一组权重在不同的内存预算上运行。我们的系统 NVE 在 NVIDIA T4 上实现了比 llama-cpp Q4_0 高 1.5-1.8 倍的解码吞吐量,并且使模型能够在以前不修改权重的情况下在以前不可行的内存机制中运行。