论文

学会再看一遍:视觉语言模型中自由形式作物路由的损失间隙监督

Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models

模型训练监督微调与指令调优

摘要

视觉语言模型 (VLM) 无法解决许多以细节为中心的问题,具体原因如下:答案在图像中可见,但在图像被压缩为低分辨率全局视图后丢失。为每个查询分配更多的视觉标记可以改善一些 OCR 和文档情况,但它会不加区别地花费计算,并且可能会干扰依赖全局上下文的任务。我们提出了 GapSight,一种学习视觉重读的框架:VLM 首先进行全局浏览,然后在问题需要局部证据时选择性地返回到自由形式区域。监督来自于目标模型自身的故障信号。离线时,我们比较仅全局视图和候选作物增强视图下的答案损失或多项选择选项余量;改善目标答案的作物成为特定于模型的评论标签。一个轻量级的自由形式裁剪路由器将这些标签提炼成一次性推理策略,该策略可以预测是否审查、预期效用以及来自全局状态的连续裁剪框。在 LLaVA-1.5-7B、InternVL2.5-8B 和 Qwen2-VL-2B-Instruct 中,GapSight 在涵盖 OCR、文档、图表、信息图表、VStarBench 和 MME-RealWorld-Lite 的六个基准上改进了基本无缩放基线。在 InternVL2.5-8B 上,GapSight 将六个基准平均值从 52.25 提高到 64.29,高于 CropVLM (57.16)、ViCrop (55.84) 和 ZoomRefine (54.43)。机制分析表明,路由器可以挽救具体的错误答案,根据任务调整其动作率,并形成良好的词元性能配置文件。这些结果将损失差距监督定位为教导 VLM 何时何地再次查看的实用途径。