论文

Vision-OPD 将局部视觉感知自蒸馏到整图策略

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

模型优化模型训练模型评测应用与实践合成数据蒸馏模型能力评测视觉感知与空间理解

摘要

多模态大语言模型仍难以完成细粒度视觉理解,答案常取决于整幅图像中很小但关键的证据。我们观察到局部到全局的感知差距:同一模型输入以证据为中心的裁剪图时,比输入相应完整图像更准确地回答细粒度问题。这说明很多失败来自难以聚焦相关证据,而非局部识别能力不足。我们提出Vision-OPD,通过局部到全局的自蒸馏,将模型自身具有信息优势的局部感知能力迁移到完整图像策略。同一模型形成两个条件策略:基于裁剪图的教师与基于完整图像的学生。学生按自身策略生成轨迹,并沿这些轨迹最小化教师与学生下一Token分布的Token级差异。由此,模型无需外部教师、真值标签、奖励验证器或推理时工具调用,也能内化视觉放大的收益。多个细粒度视觉理解基准的实验表明,Vision-OPD相对规模更大的开源、闭源及“Thinking-with-Images”Agent模型,达到可比或更好的表现。

Vision-OPD 将局部视觉感知自蒸馏到整图策略:Vision-OPD概览。左侧:在以证据为中心的裁剪图像上生成细粒度视觉问题,再通过边界框覆盖将问题定位回完整图像。右侧:教师策略p_T(裁
图4:Vision-OPD概览。左侧:在以证据为中心的裁剪图像上生成细粒度视觉问题,再通过边界框覆盖将问题定位回完整图像。右侧:教师策略p_T(裁剪输入)与学生策略p_S(全图输入)由同一多模态大模型实例化;学生生成在策略轨迹y,轨迹上逐Token的D(p_T∥p_S)提供稠密监督。梯度仅通过学生的logits传播,以无标签自蒸馏改进细粒度视觉理解。