论文

用于视觉语言推理的双潜在内存路由

Dual-Latent Memory Routing for Vision-Language Reasoning

摘要

多模态 大语言模型 (MLLM) 最近在视觉语言推理方面取得了巨大进展,但随着世代的增长,它们的性能往往会下降。一个关键因素是,他们经常在单一的增长背景下忘记早期的视觉证据和中间的限制。受人类在解决复杂任务时如何分别回忆所看到的内容和推断出的内容的启发,我们提出了 DLMR,这是一种参数有效的机制,为 MLLM 配备了双重潜在记忆:压缩图像证据的视觉记忆和跟踪中间结论和约束的推理记忆。然后,路由器动态决定在推理过程中重用哪些内存以及重用多少内存,从而保留视觉基础,同时保持连贯的长视野推理。 DLMR 分三个阶段进行训练,从潜在内存构建到选择性路由器学习,同时保持基本 MLLM 冻结,仅用少量额外的可训练参数就在通用和推理基准测试上产生了显着的收益。分析进一步显示了可解释的、状态相关的路由,具有专门的内存角色,并在长代中减少了解码词元。代码可在 https://github.com/Hunter-Wrynn/DLMR 获取。