论文

ViMoD:按推理阶段恢复细粒度视觉证据

Look Back, Think Ahead: Visual Memory on Demand for Efficient Multimodal Reasoning

模型推理上下文与知识推理加速上下文工程

摘要

多模态大语言模型(MLLM)处理高分辨率图像产生的长视觉token序列时,多步推理的计算成本很高。现有一次性剪枝和聚合方法在解码前把视觉token压缩为固定上下文。但随着推理推进,视觉证据需求会变化,固定的压缩上下文很难保留各阶段需要的全部细节。我们提出轻量框架ViMoD,在保持紧凑视觉上下文的同时,允许随推理需求变化访问原始细粒度证据。区域token的可变形聚合(DART)学习内容自适应分组和聚合容量,构造与可恢复原始Fine token关联的紧凑Coarse表示。自适应上下文证据时序路由(TRACE)整合解码历史,预测后续证据需求,并选择、保留或替换活跃Fine-token组。选中的Fine token补充冻结骨干中持续保留的Coarse上下文,使模型按阶段访问证据,而无需一直对全部视觉token计算注意力。在Qwen3-VL-4B上,以20%的目标视觉token预算,ViMoD在全部八项推理基准上优于所评估的所有基线;相对最强的一次性基线,平均归一化分数提高39.0%。新增可训练参数仅相当于冻结骨干参数的0.0546%。