论文
Multimodal LLM 是否先睹为快?诊断语境阿谀奉承
Do Multimodal LLMs See Before They Read? Diagnosing Contextual Sycophancy
摘要
外部文本可以覆盖多模态 大语言模型 中相互冲突的图像证据,我们将这种失败称为多模态上下文阿谀奉承。我们引入了一种独立改变视觉证据、常识先验和外部文本的 998 例诊断,并通过围绕上下文盲的视觉见证移动信息边界来探究何时出现这种故障。在与 Gemini 生成的虚假文本配对的异常图像上,GPT-5.1 在联合条件下得分为 7.9%,在上下文盲证人报告直接评分时得分为 49.7%,在将证人暴露于文本的匹配的两次呼叫证人仲裁管道下得分为 63.7%,在系统 2 视觉仲裁 (S2VA) 下得分为 84.2%,该管道向证人隐瞒了文本。在六个模型中,S2VA 比直接目击者报告提高了 19.7 点至 44.1 点,所有配对的 95% 置信区间不包括零。最佳信息边界并不统一:文本上下文支撑了一些模型,GPT-4o 重新生成的子集改变了联合调节、Witness-Only 和 S2VA 的相对顺序。因此,语境阿谀奉承对文本何时引入以及模型和语境来源很敏感。