论文

提取学生可以看到的内容:用于视觉语言模型的 Fisher 投影 同策略 蒸馏

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

摘要

同策略 蒸馏 (OPD) 从当前学生策略中采样轨迹,并最小化沿着这些轨迹的前缀处的学生和教师下一个词元分布之间的 词元级 分歧。这使 蒸馏 状态与学生自己的世代分布保持一致。然而,它仍然假设完整的教师分布是针对学生能力的适当目标。在视觉语言推理中,教师的纠正可能取决于紧凑型学生无法表示的视觉区别。我们的目标扩展研究表明,当目标接近完整的教师分布时,学生实现的规定转变较少,并获得较差的下游表现。因此,我们提出 \emph{Fisher-Projected 同策略 蒸馏} (FP-OPD),它仅提取本地可实现的教师修正。 FP-OPD 使用连续视觉扰动来估计学生的局部视觉切线空间,并将居中的教师-学生对数概率差距投影到学生费舍尔度量下的该空间上。由此产生的容量感知目标通过学生轨迹上的全词汇量反向 KL 进行了优化,保留了标准 OPD 框架。在 8B 到 2B 蒸馏 中,FP-OPD 改进了所有七个评估的多模式基准。与预训练学生相比,它的平均分数提高了 2.77 分,比标准 OPD 提高了 1.60 分。这些结果表明,本地可实现的教师校正为提取紧凑的视觉语言模型提供了更有效的目标。