论文

翻转之前:在视觉问答的答案发生变化之前测量量化视觉语言模型中的隐藏分数变化

BEFORE THE FLIP: Measuring Hidden Score Shifts In Quantized Vision Language Models Before The Answer Changes for Visual Question Answering

模型评测鲁棒性、公平性与可信度评测

摘要

量化通过使用更少的位来表示其权重,从而使视觉语言模型 (VLM) 的存储和运行成本更低。虽然压缩后视觉问答 (VQA) 的答案不变是预期行为,但它们仍然可以隐藏基础分数(对数概率)的变化。例如,即使“是”和“否”之间的分数差距缩小,模型在压缩后仍可能回答“是”。我们引入 BEFORE THE FLIP 来衡量这些隐藏的变化。我们的方法将压缩引起的分数变化与用一个固定的平均标记替换图像的内部表示或图像标记引起的变化进行比较。然后,我们一次提高一个权重组的精度,以确定额外的位在哪些方面有帮助,并测试为每个问题选择不同的组是否能带来超出洗牌控制的好处。在图像标记替换对分数产生显着影响的 8,277 个 LLaVA 问题中,与 8 位压缩相比,4 位压缩将是或否分数差距更靠近替换输出。 Qwen 显示了相同的模式,但差异较小。然而,9,000 个 LLaVA 答案中只有 265 个以 4 位发生变化。在对 1,024 个校准问题进行的单独研究中,在任何测试的存储预算下,为每个问题单独选择权重组的效果并不优于两个混洗控制。这些发现表明,压缩可以改变未更改答案背后的分数,但并不能通过调整每个问题的精度来确定可靠的好处。