论文

视觉语言模型中的边缘可靠性差距:量化视觉损坏下压缩 VLM 的故障模式

Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption

模型评测鲁棒性、公平性与可信度评测

摘要

用于边缘部署的大型视觉语言模型 (VLM) 的快速压缩提出了一个尚未充分研究的问题:紧凑模型是否会以不同的方式失败,而不仅仅是更频繁地失败?本研究对来自 VQAv2 和 COCO Captions 的 4,000 个样本的 70 亿参数量化 VLM(Qwen2.5-VL-7B,4 位 NF4)与 5 亿参数 FP16 模型(SmolVLM2-500M)进行了比较。应用三类错误分类法(对象盲目性、语义漂移、先验偏差)作为诊断框架。纯文本 GPT-4o 法官揭示语义漂移 (B) 是 Qwen 的 VQAv2 和 COCO 上的主要故障模式,COCO 上的 SmolVLM2 具有混合的对象失明/语义漂移配置文件;对于这两个模型,先验偏差 (C) 在 VQAv2 上存在,但在 COCO 上不存在。使用几何平均词元概率通过预期校准误差 (ECE) 来测量置信度校准,使用跨越四个模板的结构化否定探针来探测成分推理,并通过模糊鲁棒性实验完成评估。对于该模型对,紧凑模型表现出定性上明显的失败特征:否定崩溃大 12.5pp(-33.2pp 与 -20.8pp,Wald 95% CI [8.2, 16.8]pp,p < 10^-8),几乎完全由 COCO 驱动,而 VQAv2 差距在统计上并不显着(4.5pp,p=0.19)。最具辨别力的模板是 false_yn:SMOLVLM2-500M 在 100% 的 COCO 试验中回答“是”(错误地声称所描绘的对象不存在),而 Q WEN 2.5-VL-7B 的回答为 14%。不对称数据集相关的误校准和两次受控消融的模糊实验完成了分析。发布完全可重现的管道,用于在边缘部署之前对压缩 VLM 进行系统安全审核。