论文

DME 将训练期潜空间推理用于多模态Embedding

Douyin Multimodal Embedding Model Technical Report

上下文与知识模型训练模型评测应用与实践预训练检索增强评测方法与指标搜索

摘要

多模态表示学习将多模态查询和目标编码为向量,为工业搜索、推荐及Agent提供基础能力。抖音、小红书和YouTube等模态复杂、内容量大的平台,既需满足十亿级索引效率,也需区分难匹配样本的细粒度差异。现有多模态大语言模型Embedding很少兼顾二者:对比模型高效,但成对监督对细粒度差异过于粗糙;思维链模型通过显式生成改善区分,却难以在线服务。我们提出两阶段训练的抖音多模态Embedding模型DME。第一阶段通过大规模对比预训练建立覆盖多模态、多任务的统一Embedding空间;第二阶段通过两种机制补充“语义充分性”,使Embedding依托检索相关证据,并保留匹配对象侧的细粒度语义。基于证据的类型化潜空间推理,在隐藏空间组织检索证据;跨条件重建,通过双向自回归重建约束匹配对象侧语义。两种机制仅作用于训练,查询端只增加很小开销,因此在线效率与标准对比编码器相当。在MMEB-v2上,2B和9B版本分别取得74.8和78.4,在同等规模模型中达到最佳表现,尤其擅长视频和视觉文档任务。生产中,DME在抖音内部离线评测集上获得2.92%的相对提升,部署于生成式、图像及AI搜索等场景,并在抖音搜索线上A/B测试中获得0.1%的Lifetime(LT)提升。

DME 将训练期潜空间推理用于多模态Embedding:DME两阶段训练流水线概览。第一阶段以2500万组多模态查询—目标对和对比损失训练主干,建立可扩展的双编码器嵌入空间。第二阶段使用500万组
图3:DME两阶段训练流水线概览。第一阶段以2500万组多模态查询—目标对和对比损失训练主干,建立可扩展的双编码器嵌入空间。第二阶段使用500万组更高质量样本及教师生成的思维链监督,以对比损失和语义充分性损失共同优化;后者结合证据支撑的类型化潜在推理与跨条件重建。跨条件重建仅用于训练,潜在Token保留在单次编码器前向中,只增加少量查询侧开销;检索仍采用标准稠密向量相似度。