论文
ENTRAP-VL:视觉语言模型中双重上下文夹带的分类学探针
ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
摘要
上下文夹带是模型让其输入中的辅助上下文拉动其输出的趋势,无论该上下文是否相关、真实或什至有意义。最近,它已被识别并在单峰语言模型中给出了机械解释。相比之下,它是否以及如何在视觉语言模型(VLM)中表现出来,在很大程度上尚未得到检验,并且该领域缺乏专门构建的工具来研究它。我们认为,研究 VLM 中的上下文夹带需要的不仅仅是将现有的纯文本基准移植到多模态设置:它需要一个分类结构的双模态工具,其条件是围绕手头的项目构建的(文本流中描绘的图像,视觉流中的文本查询)。我们认为向 VLM 的转变是实质性的而不是渐进的。它使夹带成为一种双重现象,可以由文本和视觉上下文独立驱动,并且它打开了一种真实性区别(所描绘的场景是错误的,但在世界上可能存在的上下文),这在先前工作的单峰、仅世界知识的表述中没有对应物。为了使这一立场具体化并具有可操作性,我们引入了 ENTRAP-VL(视觉和语言的 ENRainment 评估探针),这是一个手动策划的数据集,包含 8 个类别的 1,500 个项目,按跨越两个轴的分类法组织,即上下文与项目的关联及其与事实的关系,并分为文本夹带流(八个上下文条件)和视觉夹带流(三个上下文条件)。我们并不声称可以测量任何特定模型中的夹带;我们提供工具、激励它的分类法以及它所支持的评估协议,以便社区能够严格调查这一现象。我们将公开发布数据集及其文档。