论文
超越视觉记忆:潜在视觉推理的机械诊断
Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning
摘要
最近的潜在视觉推理方法通过将连续的潜在标记插入到多模态语言模型中而取得了巨大的成果。这些收益通常归因于编码视觉证据的标记;然而,最近的分析揭示了一个悖论:标记与图像的联系松散,对答案贡献不大。至关重要的是,这些分析将潜在词元视为一个整体,从而掩盖了收益的来源。因此,我们将潜在词元分解为三个可测试的组件:潜在槽、边界标记和格式,并开发一种最先进的方法作为有利条件下的探针。在六个方法阶段设置和四个感知重的基准测试中,潜在槽未能满足视觉记忆帐户的每个预测。引人注目的是,仅保留边界标记可以在多种设置中保留 78% 至 100% 的增益,而模型在潜在位置上比在答案位置上更关注图像。这些结果不支持插槽内容作为可恢复的视觉记忆;大部分好处与标记和格式控制以及视觉注意路由相关。在匹配的精度下,方法仍然可以依赖于训练监督形成的明显不同的机制。因此,潜在视觉推理不仅需要根据准确性进行评估,还需要根据模型实际依赖的内容进行评估。