论文
TPCD:视觉语言模型中的音压对比解码和无标签门控瓶颈
TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models
摘要
高压提示可能会将视觉语言模型 (VLM) 推向不受支持的承诺,例如阅读难以辨认的文本、报告不确定的时间或确认不存在的物体。本文询问压力引起的分布本身是否可以充当对比解码负分支。音压对比解码(TPCD)从在安全中性指令下产生的logits中减去在高压指令下产生的logits。在 800 个示例的tone-matters 基准测试中,LLaVA-1.5-7B 在压力下达到 66.75% 的攻击成功率(ASR);安全中和将 ASR 降低至 9.88%;全部 TPCD 达到 0.50%,但正数跌至 15.56%。特定于基准的任务先验/不一致门保留了测量的正准确率 (54.44%),同时将 LLaVA 上的 ASR 降低至 1.63%。将此 LLaVA 分析视为设计分割,在 GLM-4.6V 和 Llama-3.2-Vision 上运行完整的 $n=800$ 阴性和 $n=780$ 匹配阳性保留运行表明,简单的门可以改进安全中和,灵敏度分析限制了弱时间阳性子任务。无类别先验的答案分歧路由器将保留的聚合 ASR 降低到 6.93%,比安全中和 (10.98%) 和分支分歧 (9.67%) 都有所提高,同时匹配分支分歧的 79.94% 正准确率,尽管它仍然是事后和基于表面形式的。我们的结论是,压力是承诺偏差的有用探测器和可行的缓解信号,但当前门控尚未被独立验证为能感知视觉依据的检测器。