论文
双稳态图像描述中的视觉语言不对称
Vision-Language Asymmetry in Bistable Image Captioning
摘要
维特根斯坦的鸭兔对视觉语言模型提出了一个问题:当模型为模糊图像添加标题时,模型中的哪个方面对某个方面做出了承诺?我们通过超过 83 个双稳态刺激的 3,320 代行为基线来解决这个问题,这些刺激在中性与强制选择提示下呈现三种状态(默认主导、力主导、力平衡),然后使用我们在 LLaVA-1.6-7B 实际消耗的 CLIP 层上训练的 TopK 稀疏自动编码器探测底层表示(验证 EV 0.93)。在具有两个可用的每方面特征池的 69 个双稳态刺激中,72% (50/69) 显示视觉塔处两个池同时激活,包括 12/12 默认主导的鸭/兔和 7/8 力平衡的年轻/年老。 CLIP 第 22 层的因果转向可翻转默认主导刺激上的字幕(在流畅性保护下,兔子翻转率为 33%),但无法在任何测试系数下翻转力平衡的年轻人/老年人上的字幕,尽管它们在视觉侧叠加。优势瓶颈位于视野塔的下游;视觉方面的表征和语言方面的承诺之间的差距是对“观看”/“观看”区别的实证处理。我们还标记了一个方法说明:TopK SAE 输出的基于排名的统计数据需要平局校正排名以避免沉默的行顺序偏差。