论文

提炼视觉证据,而不仅仅是答案:视觉语言模型的跨世界政策提炼

Distill the Visual Evidence, Not Just the Answer: Cross-World On-Policy Distillation for Vision-Language Models

摘要

视觉语言模型(VLM)蒸馏的中心目标是传递教师的语言能力及其视觉理解。然而,现有的方法主要是监督学生的输出,而使视觉理解变得隐含。我们的分析表明,学生可以在不依赖相同视觉证据的情况下匹配老师的答案,这就提出了一个问题:我们如何确保学生对实际决定答案的视觉信息做出反应?为此,我们提出 跨世界on-policy蒸馏(CW-OPD),它明确监督学生对视觉证据变化的反应。对于每个示例,CW-OPD 构建了两个视觉世界,它们共享问题和场景上下文,但答案关键证据不同,从而产生不同的答案。我们在两个世界中进行策略蒸馏,并蒸馏教师的跨世界信念转变,鼓励学生不仅匹配老师预测的什么,而且为什么其预测与证据相匹配。梯度分析表明,该项对于两个世界共有的错误是不变的,并且提供了仅对端点匹配不可见的校正信号。通过这种方式,CW-OPD 将对相关视觉证据的依赖作为明确的蒸馏目标,而不是输出匹配的隐式结果。为了诊断模型是否真正将其答案建立在视觉证据上,我们引入了 CWBench,它通过跨世界对准确性 (CWPA) 来衡量跨世界一致性。 Qwen3.5-4B 上的实验表明,CW-OPD 平均优于最强基线 1.2 点,4B 学生在 CWBench 上超过 DeepSeek-V4.1 (552B) 22.4 CWPA 点。代码发布于https://github.com/baokou-fw2/CWAD.