论文

Gaslight、Gatekeep、V1-V3:早期视觉皮层对齐保护视觉语言模型免受阿谀操纵

Gaslight, Gatekeep, V1-V3: Early Visual Cortex Alignment Shields Vision-Language Models from Sycophantic Manipulation

模型评测安全与风险评测

摘要

视觉语言模型越来越多地部署在高风险环境中,但它们对阿谀奉承操纵的敏感性仍然知之甚少,特别是在这些模型如何在内部表示视觉信息方面。视觉表现更接近人类神经处理的模型是否也更能抵抗对抗压力,这是一个悬而未决的问题,对神经科学和人工智能安全都有影响。我们通过评估跨越 6 个架构家族的 12 个开放权重视觉语言模型和沿两个轴的 40$\times$ 参数范围 (256M--10B) 来研究这个问题:大脑对齐,通过预测来自 8 名人类受试者和 6 个感兴趣的视觉皮层区域的自然场景数据集的 fMRI 响应来测量,以及阿谀奉承,通过跨越 5 个类别和 10 个难度级别的 76,800 个两轮煤气灯提示来测量。感兴趣区域分析表明,早期视觉皮层 (V1--V3) 中的对齐是阿谀奉承的可靠负面预测因子 ($r = -0.441$, BCa 95\% CI $[-0.740, -0.031]$),所有 12 个留一相关性均为负,并且对存在否认攻击的影响最强 ($r = -0.597$, $p = 0.040$)。这种解剖学上的特定关系在高阶类别选择区域中不存在,这表明忠实的底层视觉编码提供了可测量的锚点,以对抗视觉语言模型中的对抗性语言覆盖。我们在 \href{https://github.com/aryashah2k/Gaslight-Gatekeep-Sycophantic-Manipulation}{GitHub} 上发布代码,在 \href{https://huggingface.co/datasets/aryashah00/Gaslight-Gatekeep-V1-V3}{Hugging Face} 上发布数据集