论文
Llama-Mobile:VLM 的高效 2.7 位量化
Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs
摘要
由于移动设备对内存和计算的要求很高,因此在移动设备上部署视觉语言模型 (VLM) 具有挑战性。我们提出了一个量化 VLM 的框架,以便在资源受限的硬件上进行有效的推理。我们的方法结合了量化管道,该管道使用模型本身生成训练数据并且不需要访问训练设置,并采用新颖的每参数 2.7 位格式支持在 Arm CPU 上高效执行。我们通过使用 8 位激活将 Llama 3.2 11B Vision Instruct 模型压缩到 3.7 GB 来验证我们的方法,从而在一组标准视觉问答任务上保持强大的性能。