论文
更大还是更便宜?图像退化下视觉语言模型中不确定性信号的尺度和量化效应
Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation
摘要
部署在消费类硬件上的视觉语言模型 (VLM) 必须决定何时回答以及何时推迟,而该决定取决于是否有跟踪正确性的置信信号。具有固定内存预算的从业者面临着在全精度小模型、量化相同小模型和量化到相同占用空间中的较大模型之间的选择——这三种配置将置信信号推向相反的方向。我们在相同的输入上测量模型规模和 4 位量化如何影响 Qwen2-VL 系列中的两个置信度信号:模型以自然语言表示的置信度,以及其生成的答案的平均标记概率。在跨越三种严重程度的六种真实照片退化的 5,700 个预测中,我们发现规模极大地改善了模型的内部不确定性信号(从 2B 到 7B,平均错误检测 AUROC 为 0.80 到 0.98),而其言语置信度仍然很弱,并且经常是偶然的(平均为 0.61 到 0.69):模型所知道的内容和它所说的内容之间的差距随着规模的扩大而不是缩小。我们发现 4 位量化对于精度来说几乎是免费的(-1.6 点),但对于置信度信号来说却很昂贵(内部 AUROC 0.95 到 0.80,并且语言化置信度解析率从 99% 下降到 64%)。因此,对于固定内存预算,建议优先选择较大的量化模型而不是较小的全精度模型:7B-4 位可在三种适合的配置中提供最佳精度和最佳不确定性信号(内部 AUROC 0.98)。我们将结果构建为选择性预测操作点,以便它们直接转化为部署建议,并且我们认为错误检测 AUROC(而不是校准误差)是揭示两个信号之间差异的指标。