论文
Mags-RL:通过代理强化学习佩戴多模态 LLM 放大镜进行复杂场景推理
Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning
摘要
尽管多模态 大语言模型 (MLLM) 很受欢迎并取得了成功,但它通常难以准确解释图像,这限制了它们在复杂场景(例如,高对象密度和复杂背景杂波)中的推理能力。先前的工作主要通过合并明确的视觉提示(例如需要额外注释的边界框)来解决此限制。此外,由此产生的低分辨率裁剪通常会错过 MLLM 进行准确推理所需的细粒度细节。因此,我们提出了 Mags-RL,一种代理强化学习 (RL) 框架,为 MLLM 配备外部超分辨率“放大镜”代理,用于高分辨率细粒度检查。具体来说,该模型执行两轮推理:在第一轮中,它生成初始基本原理并自主识别感兴趣的区域,而不依赖于额外的注释;在第二轮中,它调用超分辨率代理来裁剪和放大这些区域,然后重新访问并验证其先前的推理以产生最终答案。我们还引入了一种新颖的课程学习策略,可以实现数据高效的 RL 训练,只需 40 个训练样本即可实现合理的性能。在 VSR、TallyQA 和 GQA 子集上的实验表明,其性能优于最近的强大竞争方法,展示了具有精确视觉基础的高质量推理。代码和权重将很快发布。