论文
品牌即记忆:视觉语言模型编码新闻来源的因果、机械本地化可信度先验
Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources
摘要
视觉语言模型 (VLM) 越来越多地以图像形式读取新闻和网络内容,其中发布者的身份以视觉方式呈现。我们证明 VLM 具有以渠道身份为关键的强大来源可信度先验,并沿着三个轴对其进行研究。 (i) 跨模型基准。我们引入了 CueTrust,这是一种跨模型诊断,可通过源覆盖索引 (SOI) 来衡量哪个表面源线索覆盖了文章的内容证据。在七个 VLM 和五个提示中,漏洞配置文件与模型和规模相关,并且覆盖是特定于出口身份且编码不变的,从报头名称、徽标图像或裸域触发,但不是从指定作者、文本内权威或页面布局(干净的负面控制)触发。 (ii) 机械账户。对于品牌线索,我们给出了一个完整的机械解释:仅交换标头可以在大约 11 个对数赔率范围内移动可信度,该范围跟踪专业收视率(通过媒体偏见/事实检查,rho = 0.88)。先验是双重编码的(名称和徽标),随着规模的增强,在第 19-21 层因果形成,由可解释的种子稳定稀疏自动编码器特征携带,并在第二个模型系列中的相同相对位置重复出现。它会覆盖内容(约 1.8 倍)作为共享路径内的信号幅度效应,而不是特权路径。控制局部方向有选择地减少覆盖(减少 41%)并推广到保留的出口,确认先验是因果使用的,而不仅仅是可解码的。因此,部署的 VLM 可能会遵循源身份而不是面前的证据,这是我们可以跨模型衡量、本地化和因果探究的可靠性故障。我们发布了刺激套件和 CueTrust。