论文
CRIT:基于图的自动数据合成增强跨模式多跳推理
CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning
摘要
现实世界的推理通常需要结合多种模式的信息,在多跳过程中将文本上下文与视觉线索连接起来。然而,大多数多模态基准无法捕获这种能力:它们通常依赖于单个图像或一组图像,其中可以仅从单个模态推断出答案。这种限制也反映在训练数据中,其中交错的图像文本内容很少强制执行互补的多跳推理。因此,视觉语言模型(VLM)经常产生幻觉并产生缺乏视觉证据的推理痕迹。为了解决这一差距,我们引入了 CRIT,这是一个新的数据集和基准,使用基于图的自动管道构建,用于生成复杂的跨模式推理任务。 CRIT 由自然图像、视频和丰富文本源等不同领域组成,并包括用于可靠评估的手动验证测试集。该基准的实验表明,即使是最先进的模型也难以完成此类推理任务。在 CRIT 上训练的模型在跨模式多跳推理方面显示出显着的进步,包括对 SPIQA 和其他标准多模式基准的显着改进。