论文
用于视觉语言推理的分解 同策略 蒸馏:视觉基础的引导梯度
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
摘要
虽然 同策略 蒸馏 为训练小型推理模型提供密集监督,但其在多模态领域的优化动态仍未得到充分探索。在这项工作中,我们通过将损失在数学上分解为两个不同的组成部分来挑战视觉语言模型(VLM)蒸馏 的标准整体视图:语言先验和视觉基础。我们的分析发现,这些分量的梯度向量几乎是正交的,这表明与教师的语言分布对齐的目标在几何上独立于匹配其视觉感知的目标。因此,标准优化被动地遵循次优折衷轨迹,隐含地平衡了两个目标。假设视觉基础构成视觉语言推理的主要瓶颈,我们引入了视觉梯度转向(VGS),这是一种动态重新定向更新向量以优先考虑视觉子空间的方法。多个 蒸馏 设置和复杂的多模态基准的实验结果表明,VGS 显着优于 同策略 蒸馏 的标准单片公式,以最小的训练开销实现了卓越的视觉定位。