论文

LQA:面向边缘视觉-语言模型的轻量级量化自适应框架

LQA: A Lightweight Quantized-Adaptive Framework for Vision-Language Models on the Edge

模型优化端侧模型

摘要

在边缘设备上部署视觉-语言模型(VLM)面临资源约束以及分布偏移下性能下降的挑战。虽然测试时适应(TTA)能够对抗此类偏移,但现有方法资源消耗过大,难以在设备上部署。为应对这一挑战,我们提出LQA,一个面向VLM的轻量级量化自适应框架,它将模态感知量化策略与无梯度测试时适应相结合。我们引入选择性混合量化(SHQ)与量化的无梯度适应机制,使VLM能够在资源受限硬件上实现鲁棒且高效的部署。在合成与真实世界分布偏移上的实验表明,LQA将整体适应性能提升4.5%,内存占用低于全精度模型,并显著优于基于梯度的TTA方法,在七个开源数据集上内存用量最多降低19.9倍。这些结果表明,LQA为在边缘设备上实现鲁棒、保护隐私且高效的VLM部署提供了可行途径。

LQA:面向边缘视觉-语言模型的轻量级量化自适应框架
图1:所提出的 LQA 示意图。(a) LQA 首先将图像流连同伪类别标签与手工设计提示拼接后的输入送入图像编码器(Radford et al., 2021);(b) 图像与文本输入由量化后的 CLIP 骨干进行编码以生成其特征;(c) 通过嵌入的余弦相似度进行预测;(d) 图像特征与预测用于更新 TDA 缓存;(e) 将 TDA 缓存应用于预测以形成最终预测。