论文

通过具有可解释生成控制的吉布斯采样探测多模态大语言模型的感知先验

Probing Perceptual Priors of MLLMs via Gibbs Sampling with Interpretable Generative Controls

模型评测模型行为与机制分析

摘要

模型在任务上的行为是由它接收的输入和它引入的先验共同决定的,即它隐式期望的刺激的分布。可解释性研究传统上通过保持输入固定并检查模型响应来研究模型,无论是机械地探究内部结构如何表示输入,还是行为地测量输入的变化如何导致输出的变化。两者都不会重建先验分布本身,因为内部结构显示模型可以表示什么,而不是它期望什么,并且任何固定的刺激集都会留下大部分可能的输入空间不可见。特别是,现实世界中的输入空间(例如 VLM 看到的图像)具有极高的维度和多样性。因此,这些先验仍然是模型的一个鲜为人知的组成部分,但仍然影响着现实世界的行为。我们提出了一种直接从模型的感知先验分布中进行采样的方法,通过引导生成模型沿可控轴产生刺激,并以所研究的模型作为判断在该空间上运行吉布斯采样。我们将其应用于各种类别和目标变量(例如面孔的可信度和艺术图像的廉价性),并恢复了规范偏差和直接提示看不见的令人惊讶的新颖先验,需要进一步研究其下游影响。

通过具有可解释生成控制的吉布斯采样探测多模态大语言模型的感知先验:论文配图
图1:我们通过在Gibbs取样器内对可解释的基因模型潜在空间进行大都会调查,来探究多模态模式的先见。在每次试验中,都展示了当前和拟议的刺激措施(与一个滑动剂不同),并要求选择与目标概念密切吻合的刺激措施。它的二进制选择认识到了一个接受巴克的步子,而横跨滑行维度的循环则使Markov链样本从模型的隐含前比目标先产生。我们采用的方法跨越四个领域(见附录A中的例子),在这些方面,模型的前身决定了这些模型如何看待我们和我们的世界。