论文

统一多模态检索的瓶颈词元

Bottleneck Tokens for Unified Multimodal Retrieval

模型训练监督微调与指令调优

摘要

采用仅解码器的多模态 大语言模型 (MLLM) 来实现统一多模态检索面临两个结构性差距。首先,现有的方法依赖于隐式池,它重载了标准词汇标记(例如,<EOS>)的隐藏状态作为序列级表示,这是一种从未为信息聚合而设计的机制。其次,对比 微调 指定嵌入应匹配的内容,但没有提供有关如何将信息压缩到其中的 词元级 指导。我们通过两个互补的组件来解决这两个差距。在架构上,我们引入了瓶颈词元(BToks),这是一组可学习的词元,用作固定容量的显式池机制。对于训练,我们提出生成信息压缩:下一个标记预测目标与压缩掩模相结合,切断从目标标记到查询标记的直接注意力路径。因此,所有预测信号都强制通过 BTok,将生成损失转换为密集的 词元级 监督以进行语义压缩。在推理时,仅在一次前向传递中处理输入和 BTok,与传统的最后词元池相比,开销可以忽略不计。在 MMEB-V2(78 个数据集、3 种模态、9 个元任务)上,我们的方法在可比较的数据条件下达到了 2B 规模方法中最先进的水平,总体得分为 59.0(比 VLM2Vec-V2 + 3.6),在语义要求较高的任务上取得了显着的进步(例如,在 Video-QA 上 +12.6)。