论文

GradeTrap:图像中的权威提示改变了 VLM 的判断,尽管有明确指示忽略它们

GradeTrap: Authority Cues in Images Shift VLM Judgments Despite Explicit Instructions to Ignore Them

模型评测模型行为与机制分析

摘要

随着视觉语言模型(VLM)的能力越来越强并被部署在相应的现实世界环境中,它们必须独立评估证据,而不是不加批判地服从人类权威。我们引入了 GradeTrap,这是一种受控评估,将两种社会线索置于直接冲突中:学生的答案应该引起阿谀奉承,而归因于同伴、老师或官方答案的冲突答案应该吸引基于权威的尊重。模型产生自由形式的答案,同时明确指示独立解决并忽略所有学生的答案、反馈和评分。我们在 60 个综合的现实世界权衡场景中测试了模型。五次中立试验建立了稳定的模型相对偏好,然后对包括对照在内的六种实验线索进行了三次重复。在 Gemini 3.5 Flash-Lite、GPT-5.6 Luna 和 Claude Haiku 4.5 的 45 项公共交叉点上,通用第二答案控制产生 5.4% 的冲突答案选择。相对于该控制,汇总的项目内更改没有显示出可靠的同行评审效应、6.9 分的教师评审效应和 19.5 分的官方关键效应。相比之下,单独显示的冲突学生答案与单独显示的学生参考答案相比,仅将选择率从 2.2% 提高到 5.2%。因此,尽管有明确的忽略指令和与官方密钥一起给出的相反的学生答案,但官方密钥的出处比学生答案或通用第二答案控制更能重定向判断。三个模型的影响程度各不相同。