论文
GHOST-Q:评估总分相近时量化视觉语言模型被掩盖的视觉依据偏差
GHOST-Q: Towards Studying Grounding Hallucinations Overlooked Under Same-score TradeOffs in Quantized VLMS
摘要
视觉语言模型(VLM)的训练后量化通常依据总体任务准确率与显存节省评估,但保持汇总得分并不保证模型仍然正确依赖视觉证据。本文提出GHOST-Q,对三个8B视觉语言模型系列在FP16、INT8和NF4下开展跨精度受控比较,覆盖一般任务效果与幻觉敏感基准。研究不只比较总体准确率,而是逐项配对FP16与量化预测,检查压缩如何重新分布视觉依据判断的成功与失败。六个量化变体中的五个把MMStar准确率保持在±2个百分点内,但36项配对效应中有10项经错误发现率校正后仍显著,其中九项位于幻觉敏感条件。同一台A100设备上的性能分析还显示,大幅降低显存占用不必然降低推理延迟。开放回答AMBER评测揭示了明显的生成预算截断,其程度随架构与精度变化。结果说明,量化VLM应同时评估总体任务效果、视觉依据可靠性、生成行为与实际部署效率。