论文

适用于视觉语言模型的 Visual-Advantage 同策略 蒸馏

Visual-Advantage On-Policy Distillation for Vision-Language Models

摘要

同策略 知识蒸馏 已被证明对语言模型有效,但其在视觉语言模型 (VLM) 中的应用仍未得到充分探索。我们观察到标准 同策略 蒸馏 可以提高学生的输出质量,但无法加强其对视觉输入的依赖:在视觉关键标记上,无论是否存在细粒度视觉细节,学生的预测在很大程度上保持不变,即使教师的预测很大程度上取决于它。为了使这种差异可观察到,我们引入了视觉优势(VA),即 词元级 对数概率当教师对学生生成的卷展进行评分时,在访问细粒度视觉细节的情况下与不访问细粒度的视觉细节时存在差异。 VA集中在极少数词元中,而这些高VA词元才是真正承载视觉监督信号的词元。这激发了 蒸馏 目标,该目标将它们与语言脚手架区别对待,因此它们的贡献不会被丰富的周围语言标记所稀释。我们提出 Visual-Advantage 同策略 蒸馏 (VA-OPD),它在两种粒度上使用 VA:通过轨迹平均 VA 进行采样轨迹级重新加权,以及在高 VA 内平均的 词元级 KL和低VA组分别。我们在两个数学数据集(Geometry3K 和 ViRL39K)上进行训练,并在 Qwen3-VL 系列上针对三种教师规模(4B、8B 和 32B)对涵盖数学推理和视觉理解的八个基准进行评估。 VA-OPD 在每个基准测试中均优于标准 同策略 蒸馏,增益沿教师规模和数据规模轴单调增长,表明这些因素一致复合。