论文
Lens:将正确的语义视角纳入免训练多模态表示学习的焦点
Lens: Bringing the Right Semantic Perspective into Focus for Training-Free Multimodal Representation Learning
摘要
高质量的表示对于广泛的下游任务至关重要。专用嵌入模型针对表示学习进行了显式优化,但与用于预训练现代大语言模型和多模态大语言模型的海量语料库相比,它们的训练数据在规模和多样性方面往往受到更多限制。大规模预训练和指令跟踪使自回归模型能够选择相关证据、整合多模态信息并在不同任务视角下推断语义,为免训练表示学习创造了独特的机会。然而,我们的分析表明,现有的语义引发方法不能可靠地将提取的状态定向到下游任务所需的语义视角。因此,所得的表示通常仍然以显着的输入内容为主。我们将这个问题描述为语义视角错位,并提出了 Lens,这是一个无需训练的框架,可以使表示读出任务导向。语义视角锚定将任务所需的视角与特定于任务的读出短语相关联,指定稍后用于提取的位置的解释角色。上下文化短语读出将相同的短语放在完整输入之后,并聚合其标记状态,将完整上下文访问与锚定视角相结合。由此产生的表示反映了任务条件的证据整合和推理,而不是对显着内容的一般总结。在没有参数更新、架构修改或重新排名的情况下,Lens 在所有 36 个 MMEB 数据集上实现了 63.9 的总体 Precision@1,比最接近的同骨干免训练嵌入基线高出 10.2 个点。