论文
从什么到哪:解码冻结 MLLM 中的修改器接地
From What to Which: Decoding Modifier Grounding in Frozen MLLMs
摘要
由于多模态大型语言模型(MLLM)可以描述日益复杂的视觉场景,因此token级基础变得至关重要。然而,当 MLLM 生成“左边的黄色香蕉”时,既定的基础方法关注图像中的内容(“香蕉”),而忽略了有助于描述哪个实例的标记(“黄色”、“左边”)。在这项工作中,我们询问冻结的 MLLM 表示是否包含有关跨生成标记的引用实例的可解码基础信息,扩展到属性、空间表达式和关系/动作术语等修饰符。为了解决这个问题,我们引入了 OTTER,这是一种基于冻结 MLLM 表示的轻量级监督探针,它使用最佳传输(OT)将生成的标记与视觉区域对齐并生成紧凑的基础图。我们的结果表明,(i)实例区分视觉信息可以从修饰符标记中解码,并具有最清晰的空间术语证据,但(ii)并不局限于它们,因为上下文化的对象名词也带有指称信息; (三) 恢复的 接地在环境扰动下仍然提供信息,而选定的区域仍然与生成相关; (iv) 基于 OT 的学习基础超越了受控设置,扩展到自由生成和跨数据集传输。