论文

检索图像作为视觉思维:无需训练 针对开放与封闭差距的多模态情境学习

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

上下文与知识检索增强

摘要

最近关于用图像思考的工作使视觉成为推理的动态部分,但这是通过生成实现的:模型调用外部工具、合成代码或想象新的图像,每一个都以工具协议、脆弱的代码或昂贵的训练管道为代价。第四条路线通过检索标记的示例图像并对它们进行推理,使视觉变得动态而不产生任何东西,但尽管没有火车,但它仍然未被充分探索。我们提出了 ReVisIT,这是一个无需训练的框架,通过将每个检索到的图像标签对视为视觉思维的单位来实现这种基于检索的路线。 ReVisIT 结合了结构化类定义、每个查询的示例多模式检索以及在联合多属性解码之前交替用户/助理注入这些示例,并优雅地降级为任务允许的任何组件。在 VL-ICL Bench Fast Open MiniImageNet 上,采用 ReVisIT 的 Qwen3-VL-30B-A3B 在 4 次拍摄时达到 98.5%,在大约 1/2.4 参数的这项接近饱和任务中,从统计角度来看,与 72B LLaVA-OneVision SOTA (98.7%) 没有什么区别,而没有支架的相同骨干网则处于偶然状态。仅 Turns 层就在自由形式概念归纳(Bongard-OpenWorld)上为 GPT-4.1 添加了 26.1 分,并且整个堆栈在 MAAC-Bench 上的三个主干上产生了 4-6 分的宏观收益,MAAC-Bench 是一个新的许可干净的 27 类、5 属性基准,通过对策展人衍生属性的配对引导而显着。成分分析表明,检索加转向是通用杠杆,而结构化定义是需求自适应的,并且 83% 的检索增益来自检索质量,而不是来自样本的存在。 MAAC-Bench 发布了基于标题的 LLM 验证协议,该协议取代了作者对主观属性的抽查。