论文
视觉对比自我-蒸馏
Visual Contrastive Self-Distillation
摘要
同策略 self-蒸馏 (OPSD)很有前途,因为它消除了同策略 蒸馏 (OPD)所需的外部教师,但它仍然需要教师和学生之间的不对称信息,以确保自教师提供比学生更强的学习信号。现有方法通过特权答案或视觉证据造成这种不对称。我们询问是否可以将两者删除,从而产生纯粹由输入条件驱动的更简单形式的 OPSD。为此,我们提出了视觉对比自蒸馏,即VCSD,它将图像内容去除转换为同策略自蒸馏信号。对于每个学生生成的响应前缀,EMA 教师在相同的提示和前缀下生成两个下一个标记分布——一个以原始图像为条件,另一个以内容擦除控件为条件。它们的标记对数概率差异突出显示了实例级视觉内容特别增加可能性的候选者。我们利用这种对比来在合理的支持范围内强化教师的原始图像分布,并将最终的完整分布目标提炼到学生身上。使用 ViRL39K 数据集,VCSD 在 Qwen3-VL 和 Qwen3.5 模型中始终优于匹配的 OPSD。例如,在 Qwen3-VL 上,它改进了 7 基准聚合,从 2B 时的 $62.27\% \rightarrow 67.04\%$、4B 时的 $71.30\% \rightarrow 73.16\%$ 到 8B 时的 $72.51\% \rightarrow 76.26\%$。此外,VCSD 不需要外部教师、特权答案、视觉证据信号、推理痕迹或额外的推理时间成本。