论文
Vision-OPD 将局部视觉感知自蒸馏到整图策略
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
摘要
多模态大语言模型仍难以完成细粒度视觉理解,答案常取决于整幅图像中很小但关键的证据。我们观察到局部到全局的感知差距:同一模型输入以证据为中心的裁剪图时,比输入相应完整图像更准确地回答细粒度问题。这说明很多失败来自难以聚焦相关证据,而非局部识别能力不足。我们提出Vision-OPD,通过局部到全局的自蒸馏,将模型自身具有信息优势的局部感知能力迁移到完整图像策略。同一模型形成两个条件策略:基于裁剪图的教师与基于完整图像的学生。学生按自身策略生成轨迹,并沿这些轨迹最小化教师与学生下一Token分布的Token级差异。由此,模型无需外部教师、真值标签、奖励验证器或推理时工具调用,也能内化视觉放大的收益。多个细粒度视觉理解基准的实验表明,Vision-OPD相对规模更大的开源、闭源及“Thinking-with-Images”Agent模型,达到可比或更好的表现。
