看看它的价值所在:用于细粒度视觉语言推理的免费、无标签视觉证据信号
Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning
摘要
多模态大语言模型(MLLM)在处理细粒度视觉问题时失败,与其说是因为它们无法推理,不如说是因为它们从未看到证据:高分辨率图像在编码之前会被下采样,因此模型会根据语言先验来回答。标准的补救措施是昂贵的:带注释的答案(SFT)、手工设计的验证器(RLVR)或大型外部教师(政策蒸馏)。我们询问视觉证据本身是否可以免费提供信号。我们形式化了对比证据差距,即模型在以问题相关区域与不相关区域为条件时分配给自己输出的每个标记的对数似然比,并在 V*Bench 上的 Qwen2.5-VL-7B、Qwen3-VL-8B 和 Qwen3-VL-30B-A3B 上进行研究。我们的主要积极结果是无需训练:使用单视图、无标签标准选择模型答案分布最峰值的候选作物,发现没有边界框、训练或标签的答案承载区域。它定位目标的能力比偶然性好 4.4 到 5.1 倍,并将推理时的细粒度准确度从 70% 提高到 85%。我们进一步表明,这种差距与模型自身的信心是互补的。将它们组合起来比单独使用任何一个都可以更好地预测正确性,AUC 高达 0.99,并自信地标记错误答案,在高置信度子集中 AUC 范围从 0.97 到 1.00。所有影响都集中在感知瓶颈问题上,而在全局背景控制上消失。最后,我们报告了一个诚实的负面结果:将相同的信号转换为训练方法,门控自蒸馏(SEG-Distill),在三种门设计的试点规模上的表现并不优于基本模型,而更激进的门控会降低准确性。信号是真实的,但将其转换为训练增益仍然是一个悬而未决的问题。