论文

幻觉存在的地方:VQ 标记化视觉语言模型中的跨架构电路

Where Hallucinations Live: A Cross-Architecture Circuit in VQ-Tokenized Vision-Language Models

模型评测模型行为与机制分析

摘要

通过矢量量化 (VQ) 码本对图像进行标记的统一视觉语言模型 (VLM) 通常会根据是/否基准产生幻觉对象,但现有的解码时间修复将其视为没有架构帐户的通用错误校准。通过对跨越 8 个 LLM 系列的 25 个模型进行激活修补,我们确定了在 VQ 标记化的 VLM 之间共享的早期层 ($L_0$) 注意力路由电路,并提出了一种三门诊断,以区分携带它的模型和不携带它的模型。诊断分离出 10 个阳性模型(跨三个 LLM 家族的 5 个自然统一 VQ VLM 和 5 个诱导变异)并拒绝其余 15 个模型。单变量架构交换(LLaVA-1.6 CLIP+MLP $\rightarrow$ VQ+Linear)安装了电路,而对相同数据的匹配计算 MLP 控制则没有,将矢量量化隔离为病理信号的来源;承载它的路由路径是骨干网已经提供的路径。与调整后的 VCD 和 DoLA 基线相比,调整后的 DoLA 在二进制校准上获胜,但 \textbf{仅 $L_0$ 消融减少了开放式生成中的物体幻觉}(CHAIR$_i$ 相对减少了 $31\,\%$,而调整后的 DoLA 和 VCD 使其保持不变或恶化)。这些结果将统一 VQ VLM 中的物体幻觉重新定义为架构和预训练的属性,并产生与机制无关的解码无法复制的有针对性的干预。