论文
基于CPU-GPU内存交换实现视觉-语言-动作模型的免OOM Alpamayo推理
OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models
摘要
面向自动驾驶的端到端视觉-语言-动作(VLA)模型将感知、推理和控制统一在单一神经网络中,取得了出色的驾驶性能,但需要20-60GB的GPU显存,远超消费级GPU可用的12-16GB。我们提出一个框架,仅通过系统级优化即可在显存受限的GPU上实现省显存的VLA推理,无需修改模型。本工作分三个阶段:(1) 顺序按需分层(Sequential Demand Layering)将显存使用从模型级粒度降到层级粒度;(2) 流水线按需分层(Pipelined Demand Layering)通过传输-计算重叠将参数传输时间隐藏在层执行时间内;(3) GPU常驻层决策策略基于逐模块驻留收益分析,消除流水线无法隐藏的剩余传输开销。我们进一步提出一个性能预测模型,仅需一次剖析运行即可确定最优配置——包括常驻层的数量与布置——在所有配置上的预测误差低于1.3%。应用于RTX 5070Ti(16GB)上的NVIDIA Alpamayo-R1-10B(21.52GB),本工作相比Accelerate offloading实现最高3.55倍加速,同时保持完整BF16精度。
