论文

阐明通用多模态嵌入中的视觉识别

Illuminating Visual Identity in Universal Multimodal Embeddings

模型训练监督微调与指令调优

摘要

通用多模态嵌入(UME)旨在将各种模态和任务统一到共享表示空间中。近年来,在多式联运大语言模型(MLLM)的发展推动下,该领域取得了实质性进展。然而,尽管视觉身份识别这一关键功能在人工智能生成内容中的实例检索、重新识别和身份保存等广泛任务中发挥着关键作用,但在现有 UME 方法中仍未得到充分探索。为了弥补这一差距,我们提出了视觉身份识别的统一公式~(VisID),并引入了 $\textbf{MVEB}$ ($\textbf{M}$ultimodal $\textbf{V}$isual Identity $\textbf{E}$mbedding $\textbf{B}$enchmark),这是一个从现实世界和合成数据集策划的大规模基准,用于支持评估和训练。此外,我们提出了一个简单而有效的学习框架,通过精心设计的身份感知采样机制,联合优化一般多模式和视觉身份表示。大量的实验表明,我们的方法成功地赋予 UME 强大的身份辨别能力,并保持有竞争力的一般多模态性能。我们相信这项工作不仅阐明了一个关键但被忽视的能力,而且还朝着更全面的通用多模态嵌入迈出了一步。代码和数据可在 \href{https://chrisclear3.github.io/MVEB}{MVEB} 获取。