论文
是什么阻碍了潜在的视觉推理?
What's Holding Back Latent Visual Reasoning?
摘要
人类可以通过在心理上模拟中间视觉步骤来解决复杂的视觉问题,而不是仅仅通过语言进行推理。受此启发,一些关于视觉语言模型的作品最近探索了以连续潜在标记作为中间视觉想象步骤的思想链推理。在这项工作中,我们研究了最新的模型如何利用此类潜在词元。令人惊讶的是,我们发现当潜在标记被无信息的虚拟标记替换时,模型准确性不受影响。这表明潜在标记在模型的最终预测中起着最小的因果作用。为了更好地理解这种现象,我们分析了预言机潜在表示提供的训练信号和推理时生成的潜在标记的质量。我们的实验揭示了阻碍潜在视觉推理的两个关键问题:首先,在大多数现有数据集中,预言机潜在标记提供了原始图像之外的有限附加信息,并且没有显着简化任务,导致模型在训练期间忽略它们,并在推理时有效绕过它们。当对诊断数据集进行微调时,其中潜在标记为最终预测提供了足够的支持,我们表明模型可以因果地依赖它们。其次,在推理时产生的潜在词元偏离了相应的预言表示,从而崩溃到一个狭窄的区域,并且即使模型依赖它们,也无法获得好处。总的来说,我们的研究结果表明,潜在视觉推理的未来进展取决于两个关键支柱:具有信息丰富的中间步骤的高质量数据集和更精确的潜在标记预测。