论文

监督前的感知:来自反事实盲点的独立视觉 蒸馏

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

摘要

多模式 大语言模型 (MLLM) 的自我改进通常由仅提供粗略标量反馈的基于奖励的方法驱动。 蒸馏 通过密集的 词元级 监督提供了更丰富的替代方案,但在视觉领域,它通常依赖于使用外部注释和工具或更强大的模型构建的特权上下文。我们引入了 \textbf{CVPD}(对比反事实视觉过程 蒸馏),据我们所知,它是第一个用于 MLLM 的密集、同策略、词元级 视觉自 蒸馏 的完全独立的框架。 CVPD 可识别视觉盲点,其中放大某个区域会发生变化并锐化模型的答案分布,而删除同一区域则使整个图像的行为基本保持不变。这些区域揭示了模型可以编码但无法在全图像条件下一致利用的感知信息。我们提出了一个三门反事实标准,直接从模型自身的响应中识别这些区域,并将它们转换为自我 蒸馏 的密集对比监督。在 Qwen3-VL-8B-Instruct 上,CVPD 在 12 个基准测试中优于 6 个自我演化基线,包括依赖外部 GPT-4o 监督的方法,而无需进行单一回归。它在 OCRBench 上获得了 $+3.60$ 的收益,在 MMStar Fine-Grained Perception 上获得了 $+3.38$ 的收益,在 MMStar Logical Reasoning 上获得了 $+3.08$ 的收益,同时保持或提高了更广泛的多模式基准上的性能。