论文

问两次,看两次:提示回声解决了视觉语言模型中的问题第一悖论

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 提示中的问题应该放在哪里:图像之前还是图像之后?直觉之前说过:知道所问的内容应该告诉模型该往哪里看。然而,在视觉问答基准测试中,问题优先提示始终不如前沿 VLM 推荐的图像优先排序,我们将这种现象称为问题优先悖论。我们将这个悖论追溯到 VLM 计算的两个阶段之间的冲突。 logits 镜头和注意力探针表明,问题优先提示会引导感知,将图像块表示转向与问题相关的概念。但在下游,困在数百个图像标记后面,问题几乎没有答案标记,而是致力于图像驱动的、通常是错误的答案。因果注意力剔除确认答案仅在跟随图像时才读取问题。此诊断产生了 无需训练 修复:问题回显,在图像的两侧重述问题,以便一个副本引导感知,而另一个副本在回答时可用。类似的分工出现在一项五十年前关于人类“附加问题”的发现中,在一篇文章之前和之后重复一个问题可以提高理解力。通过恢复整个图像视图,回显图像也带来了进一步的收益,否则会被因果解码器丢失。该悖论在 5 个开放 VLM 中成立,导致组准确度损失高达 17.5 点。回声提示弥补了大部分差距,并且在 NaturalBench 和 Winoground 上超过了 Winoground 上的最佳单遍排序多达 19 个组精度点,无需任何训练、微调 或架构更改。这个悖论揭示了控制模型所看到的内容和保留对所要求内容的访问之间的紧张关系。 echoing 通过提示设计解决了这个问题。项目页面:https://rakshanda-cmu.github.io/ask-twice-look-twice/