论文

通过复杂的视觉查询进行符号和抽象推理

Symbolic and Abstractive Reasoning with Complex Visual Queries

模型训练合成数据

摘要

对于当前的多模态 大语言模型 (MLLM) 来说,抽象视觉内容的理解和推理仍然是一个挑战。在本文中,我们探索了一种称为复杂视觉查询(CVQ)的新型抽象数据类型,旨在探索符号和抽象推理,这是 MLLM 的类人神经符号推理的一个关键但尚未充分探索的维度。我们从三个角度进行全面的调查:\textbf{数据$\times$范式$\times$探索}。具体来说,我们提出了一个可扩展的管道,用于合成基于大规模多模态知识图的 CVQ,通过一阶逻辑运算符的系统组合生成包含 14 种不同查询类型的多样化数据集。我们进一步引入了一个两阶段训练框架,逐步为 MLLM 配备强大的视觉推理能力。我们进行了大量的实验,从多个维度严格评估 MLLM,包括 CVQ 的推理性能,以及跨任务和跨场景泛化。我们相信我们的工作为推进 MLLM 的推理前沿开辟了新的视角和途径。