小视觉语言模型知道自己何时错了,但不能这么说:现实图像退化下的陈述与内部信心的两种模型研究
Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation
摘要
视觉语言模型 (VLM) 越来越多地部署在消费类硬件上,其中输入图像会因压缩、相机抖动和光线不足而质量下降。在这种情况下,可靠的不确定性信号比原始准确性更重要,因为它决定系统何时应该推迟而不是应答。我们评估了两个小型开放权重 VLM(Qwen2-VL-2B-Instruct 和 SmolVLM-Instruct),涵盖三个严重级别的六种真实摄影退化,比较两个置信度信号:模型以自然语言表示的置信度,以及模型自身对其生成答案的平均标记概率。在 3,800 个预测中,我们发现存在巨大且一致的差距。 Qwen2-VL 的语言置信度几乎恒定(所有条件下的平均值为 0.87-0.90),并在机会级别检测其自身的错误(AUROC 0.39-0.75,通常约为 0.50),而来自同一模型的内部标记概率使用 AUROC 0.92-0.99 将正确答案与错误答案分开。在 SmolVLM 中,语言化的置信度被证明在很大程度上是无法获得的:在三个提示模板中,五次试点尝试中只有一次产生了可解析的置信度值,而内部概率再次产生了高于机会的错误检测(AUROC 0.54-0.92)。两种模型都在同一个地方失败:在严重曝光不足的情况下,精度崩溃(Qwen2-VL 为 0.99->0.22,SmolVLM 为 0.97->0.42),而两个置信信号几乎没有移动,并且内部错误检测偶然发生。我们得出的结论是,小型 VLM 编码了它们的语言输出无法表达的可用自我知识,因此内部概率是受限部署中更好的延迟信号,并且在严重的低光条件下,这两个信号都不应该被信任。