论文
学习聚焦和精确裁剪:具有信息差距和 MLLM 基础损失的强化学习框架
Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs
摘要
为了增强多模态 大语言模型 在复杂视觉场景中的感知和推理能力,最近的研究引入了基于代理的工作流程。在这些工作中,MLLM 自主地利用图像裁剪工具来分析感兴趣的区域以回答问题。虽然现有的训练策略,例如采用监督 微调 和强化学习的策略,已经取得了重大进展,但我们的实证分析揭示了一个关键的局限性。我们证明了该模型对全局输入的强烈依赖以及对裁剪区域内细节的弱依赖。为了解决这个问题,我们提出了一种不需要轨迹监督的新型两阶段强化学习框架。在第一阶段,我们通过调整全局图像的粒度引入“信息间隙”机制。该机制通过关注裁剪的关键区域(由这些区域提供的信息增益驱动)来训练模型回答问题。第二阶段通过使用少量边界框注释,通过合并定位损失进一步提高裁剪精度。实验表明,我们的方法显着增强了模型对裁剪区域的关注,使其能够在高分辨率视觉上实现最先进的性能我们的方法提供了一种更有效的方法来感知和推理 MLLM 中的细粒度细节。代码位于:https://github.com/XuanPu-Z/LFPC。