论文

ReMAP:用推理时间潜在视觉记忆恢复感知循环

ReMAP: Restoring the Perceptual Cycle with Reasoning-Time Latent Visual Memory

摘要

由于多模态大语言模型 (MLLM) 时间较长,对初始视觉输入的注意力减弱,视觉定位减弱。 Visual 记忆在推理过程中重新引入视觉证据。我们沿着三个轴对视觉记忆进行受控分析:策展、组织和访问。我们发现局部证据受益于全局上下文,紧凑的潜在表示平衡了准确性和视觉上下文成本,并且记忆访问的效用取决于推理状态。在这些发现的指导下,我们提出了 ReMAP(推理时间记忆增强感知),它将两个互补的潜在记忆结合起来:一个静态的、有问题条件的全局记忆,它保留场景和跨图像上下文;以及一个动态的局部记忆,它使用此上下文作为锚点,同时根据当前推理状态选择和重新编码区域级证据。两个记忆都返回插入到推理序列中的紧凑潜在token,并且用分支执行轨迹训练的强化学习访问策略决定何时继续推理或调用全局或局部记忆。在 10 个基准测试系列中,ReMAP 在所有四个多图像基准测试中均优于先前的视觉记忆方法,比 MuirBench 和 MIMIC 上最强的先前结果高出 8.38 和 14.84 个百分点。在四个骨干模型系列中,启用记忆访问比禁用记忆的相同训练模型有所改进,并且在共享 V*Bench、CV-Bench-2D 和 MuirBench 问题上,ReMAP 相对于原始分辨率骨干模型将输入推理序列的视觉token减少了 51.0-76.8%。进一步的分析表明,全局和局部记忆形成不同但互补的潜在表示。这些组件共同通过让推理状态触发有针对性的视觉检索来恢复感知循环,并用检索到的证据指导后续推理。

ReMAP:用推理时间潜在视觉记忆恢复感知循环的原论文方法或结果图
图 2:ReMAP 概述。全局记忆在解码之前形成各个图像及其关系的问题条件摘要。在推理过程中,本地请求使用当前状态来选择源和区域,重新编码所选像素,并使用缓存的全局上下文压缩它们。全局和本地返回作为连续潜在块插入到其请求标记之后,然后在自回归解码恢复之前插入结束标记。