论文
视觉语言模型中的源模态监控
Source-Modality Monitoring in Vision-Language Models
摘要
我们定义并研究源模态监控——多模态模型跟踪和传达信息来源的输入源的能力。我们将源模态监控视为更一般的绑定问题的一个实例,并评估模型利用句法信号与语义信号的程度,以便将用户提供的提示中的图像等单词绑定到其输入和上下文的特定组件(即实际图像)。在跨越 11 个执行目标模态信息检索任务的视觉语言模型 (VLM) 的实验中,我们发现句法和语义信号都发挥着重要作用,但在模态分布高度不同的情况下,后者往往胜过前者。我们讨论这些发现对模型稳健性以及在日益多模式代理系统的背景下的影响。