论文

重新思考小型 VLM 量化:从组件分析到硬件感知边缘部署

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

模型评测模型行为与机制分析

摘要

参数少于30亿的视觉语言模型的出现,加速了设备端多模态智能的落地。然而,对组件量化的详细理解仍然是最佳部署的瓶颈。本文提出了一个系统评估框架,用于在 Jetson Orin NX 和 AGX 上通过六种量化配置实证验证五种假设。通过分离视觉编码器、投影仪和 大语言模型 主干网,可得到以下结果:(1) 量化灵敏度由结构范式(MoE 与密集)控制,而不是单独由尺度决定,MoE 主干网可减轻密集主干网退化时的 INT4 噪声; (2) SigLIP 编码器在 Jetson Ampere 上产生不成比例的 INT8 延迟——这是特定于部署的编码器-内核-硬件交互,而不是 SigLIP 缺陷; (3)虽然LLM的INT4量化大大降低了VRAM消耗,但由于反量化开销也导致词元生成速度变慢; (4) 复合量化误差很大程度上是相加的,除了沿着模态对齐路径,这是依赖于架构的; (5) 由于内存带宽限制,每焦耳智能分布在不同平台上存在显着差异。