论文

视觉输入及其框架影响大型视觉语言模型生成的基于属性的描述

Visual Input and Its Framing Affect Attribute-based Descriptions Produced by Large Vision-Language Models

模型评测模型行为与机制分析

摘要

大型视觉语言模型 (LVLM) 通常仅使用单个文本提示作为输入,或加上图像。在本文中,我们证明,当图像存在时,即使文本提示不是关于该图像中的特定实例(而只是其所属的概念),响应仍然会受到影响。例如,当文本提示仅询问狗品种的属性描述时,描绘该品种的特定狗的图像会改变响应。此外,特定实例在该图像中的呈现方式将决定响应的方向。详细分析还表明,在回复中,物理术语从纯文本的 18% 增加到以主题为中心(主题情境)框架的 45% (40%)。总体而言,视觉线索对 LVLM 的意外影响凸显了在评估 LVLM 的稳健性时了解图像的存在及其框架的必要性。