论文
通过具有可解释生成控制的吉布斯采样探测多模态大语言模型的感知先验
Probing Perceptual Priors of MLLMs via Gibbs Sampling with Interpretable Generative Controls
摘要
模型在任务上的行为是由它接收的输入和它引入的先验共同决定的,即它隐式期望的刺激的分布。可解释性研究传统上通过保持输入固定并检查模型响应来研究模型,无论是机械地探究内部结构如何表示输入,还是行为地测量输入的变化如何导致输出的变化。两者都不会重建先验分布本身,因为内部结构显示模型可以表示什么,而不是它期望什么,并且任何固定的刺激集都会留下大部分可能的输入空间不可见。特别是,现实世界中的输入空间(例如 VLM 看到的图像)具有极高的维度和多样性。因此,这些先验仍然是模型的一个鲜为人知的组成部分,但仍然影响着现实世界的行为。我们提出了一种直接从模型的感知先验分布中进行采样的方法,通过引导生成模型沿可控轴产生刺激,并以所研究的模型作为判断在该空间上运行吉布斯采样。我们将其应用于各种类别和目标变量(例如面孔的可信度和艺术图像的廉价性),并恢复了规范偏差和直接提示看不见的令人惊讶的新颖先验,需要进一步研究其下游影响。
