论文

缩放前先查看:Visual RAG 中分辨率上下文权衡的自适应路由

Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG

上下文与知识检索增强

摘要

随着与查询相关的对象变得更小,视觉语言模型 (VLM) 陷入困境。为了解决这个问题,最近的 无需训练 方法动态检索并放大局部图像区域。然而,我们表明,不加区别地应用检索忽略了一个关键漏洞:分辨率与上下文的权衡。基于补丁的缩放可以恢复小目标的细节,但可以分割大对象并破坏全局空间上下文;基于注意力的检索可以更好地保留大对象,但在微小细节上仍然不太可靠;当不需要检索时,全局感知通常是最快的。受这些故障模式的推动,我们引入了 ViRGo(视觉检索或全局感知),这是一个轻量级框架,它将视觉检索表述为自适应路由问题。 ViRGo 在初始前向传递过程中根据 VLM 的固有定位头估计对象规模,并将其与语义标记置信度相结合,以在全局感知、基于补丁的检索和基于注意力的检索之间进行选择,并且只需最少的额外计算。跨多个 VQA 基准和对象大小组的实验表明,ViRGo 改善了准确性与效率的权衡:它匹配小细节上的补丁检索,利用基于注意力的检索来检索较大的对象,并在不需要缩放时通过路由到全局基线来减少推理时间。