论文

资源受限的消费者 GPU 上视觉模型和 VLM 的具有自适应检查点的高效 PEFT 方法

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs

模型训练参数高效训练

摘要

现代预训练视觉模型可实现很高的准确性,但 微调 需要大量 GPU 内存,这使得边缘部署不切实际。本文比较了设备上 VRAM 预算(例如 2 GB)下 Transformer(ViT-Small、TinyViT)和基于 Mamba 的视觉主干(Vim-Small、MambaVision-T)上的五种参数高效 微调 (PEFT) 方法(Full FT、LoRA、AdaLoRA、QLoRA、BitFit)以及三种方法梯度检查点策略(无、静态和提出的内存预算感知自适应算法);我们评估了三个基础模型基线系列:零样本对比视觉语言模型(OpenCLIP、SigLIP)、具有轻量级评估协议的自监督视觉主干(DINOv2)以及用于基于提示的分类的自回归 VLM(PaliGemma、MobileVLM、SmolVLM)。 CIFAR-100 和 DTD 的实验报告了准确性、训练时间、能量和 NetScore 系列多目标指标,我们通过两个部署感知变体对其进行了扩展。 QLoRA 和 BitFit 以 1-2% 的准确度成本减少了 20-30% 的能源;自适应算法将峰值内存减少 43-79%,能源开销减少 9-30%。 DINOv2 以一小部分能量超越了 CIFAR-100 上的微调模型(0.917 与 0.897),而小型自回归 VLM 仍然没有竞争力。