论文
时空阿谀奉承:视频中基于否定的煤气灯 大语言模型
Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
摘要
视频 大语言模型 (Vid-LLM) 在视频理解任务中表现出了卓越的性能,但其在对话交互下的鲁棒性在很大程度上仍未得到充分探索。在本文中,我们识别了时空阿谀奉承,这是一种失败模式,其中 Vid-LLM 收回最初正确的、基于视觉的判断,并在基于否定的煤气灯下符合误导性的用户反馈。这些模型不仅仅是改变答案,还经常编造不受支持的时间或空间解释来证明不正确的修改是合理的。为了系统地研究这一现象,我们提出了一个基于否定的煤气灯评估框架,并引入了 GasVideo-1000,这是一个精心设计的基准,旨在探讨具有清晰视觉基础和时间推理要求的时空阿谀奉承。我们在不同的视频理解任务中评估了各种最先进的开源和专有的 Vid-LLM。大量实验表明,即使在具有强大基线性能的模型中,基于否定的煤气灯操纵的脆弱性也是普遍且严重的。虽然即时水平的基础约束可以部分缓解这种行为,但它们并不能可靠地防止幻觉的理由或信念逆转。我们的结果表明,当前的 Vid-LLM 缺乏在对抗性对话反馈下维持扎根时空信念的强大机制。