论文

重新思考多图像理解中的多图像重新表示

Rethinking Multi-Image Re-Representation in Multi-Image Understanding

智能体系统Agent Harness

摘要

多图像理解要求 MLLM 不仅要识别单个图像的内容,还要组织分布在图像中的视觉证据。我们通过多图像重新表示、观看提示的思维链推理和使用 Agentic 视觉工具作为推理过程中重新组织视觉证据的不同方式来研究这个问题。我们引入了 Mosaic,这是一种通用的多图像视觉工具,它使 MLLM 能够通过十个可组合图像操作主动构建视觉中间体。我们比较了现有多图像基准和 MosaicBench 上的五种重新表示设置,MosaicBench 是一种新的以基础为中心的基准,用于细粒度多图像理解。我们的实验表明,文本和视觉重新表示的相对好处强烈依赖于任务。视觉重新表示对于需要精确视觉证据的任务特别有效,包括假设检验、精确比较和方向敏感推理,而由高级语义内容主导的任务则显示出较小或不太一致的增益。基于这一发现,我们训练 MosaicAgent-8B 使用 Mosaic 进行强化学习,仅使用准确性和格式奖励。在没有特定工具使用的演示轨迹或奖励的情况下,Agent学习通过多个步骤组成视觉操作,并自发地展示不同的问题解决模式。代码和数据将在https://github.com/gengyuanmax/Mosaic.发布