论文
FLIP:用最终层干预验证视觉语言机制解释
FLIP: Final Layer Inference-Time Probing for Vision-Language Models
摘要
FLIP是一种最终层推理时探针,用于检验开放权重视觉语言模型中面向logit的干预位置,是否承载结构化、任务相关计算。单看内部干预导致的行为变化难以解释机制,因为变化可能来自更好地使用视觉证据、普遍的输出不稳定或彻底退化。FLIP在计算logit之前,给最终归一化隐藏状态的每个元素设置下限,保持参数、提示和解码不变。在受控检测与计数探针上,扫描干预强度得到三个区域:变化可忽略;有界的中间区域,在该区域IoU为0.50时的检测召回率提高、容差计数误差下降;以及过度抑制。论文提出包含四项判据的探针与扫描协议:区域结构、与视觉定位代理指标对齐、对特征一致性的依赖,以及基于性能的阴性对照无法重现相同正向区域。传入输出头的归一化后状态是面向logit的具体测试位置,在非定向的下限扫描中满足全部协议。原始解码器层干预(包括最终归一化之前的最后块输出)和单例—成对左右对照无法重现最终位置的特征,而同位置的其他算子和多个VLM能够重现。因此,FLIP是对基于干预的机制可解释性进行验证的步骤,并非行为引导方法。