论文
LQA:面向边缘视觉-语言模型的轻量级量化自适应框架
LQA: A Lightweight Quantized-Adaptive Framework for Vision-Language Models on the Edge
摘要
在边缘设备上部署视觉-语言模型(VLM)面临资源约束以及分布偏移下性能下降的挑战。虽然测试时适应(TTA)能够对抗此类偏移,但现有方法资源消耗过大,难以在设备上部署。为应对这一挑战,我们提出LQA,一个面向VLM的轻量级量化自适应框架,它将模态感知量化策略与无梯度测试时适应相结合。我们引入选择性混合量化(SHQ)与量化的无梯度适应机制,使VLM能够在资源受限硬件上实现鲁棒且高效的部署。在合成与真实世界分布偏移上的实验表明,LQA将整体适应性能提升4.5%,内存占用低于全精度模型,并显著优于基于梯度的TTA方法,在七个开源数据集上内存用量最多降低19.9倍。这些结果表明,LQA为在边缘设备上实现鲁棒、保护隐私且高效的VLM部署提供了可行途径。
