论文
缓慢地发现,缓慢地抑制:理解语境记忆冲突中模态的影响
Slow to See, Slow to Suppress: Understanding the Effects of Modality in Context-Memory Conflicts
摘要
我们研究视觉语言模型(VLM)如何处理上下文记忆冲突;也就是说,模型在上下文中获得的信息与训练期间参数化存储的信息不同。我们记录了不对称偏差:模型倾向于更喜欢文本中出现的实体的上下文信息,但更喜欢图像中出现的实体的参数信息。我们将这种不对称性与跨模态的后期表征对齐联系起来,表明与解析视觉实体相关的较长处理时间可以防止抑制模型通常的事实回忆机制,从而产生更多参数化答案。思维链推理似乎并不能解决这一差距,但增加上下文中的视觉信息量确实显示出效果。这些结果说明了随着模型变得越来越多模态和检索增强,确保行为一致的复杂性。