论文
WeMM-Embedding:微信多模态嵌入技术报告
WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
摘要
通用多模态嵌入正在成为现代人工智能系统的核心组件,使异构内容能够在共享空间中表示,用于检索、推荐、分类和代理系统等应用。在本报告中,我们提出了 WeMM-Embedding,这是一系列通用多模态嵌入模型,支持文本、图像、视频、视觉文档以及具有灵活输出维度的任意交错多模态输入。该系列包括 2B、4B 和 9B 变体,并分两个阶段进行训练:大规模多模式对齐阶段,然后是使用精选数据、细粒度相关性监督和跨规模知识转移的细化阶段。经过广泛的评估,WeMM-Embedding 在多个公共基准上取得了领先的性能。值得注意的是,2B 变体已经超越了之前在 MMEB-v2 上领先的 8B 开源基线,而 9B 变体进一步达到了新的最先进总分 80.6。 WeMM-Embedding 还在微信应用程序中展示了强大的实际性能,在 26 项内部基准测试中取得了显着的进步,并在 14 项在线 A/B 测试中取得了一致的改进。它已在推荐和搜索应用程序中大规模部署,包括微信频道、公众号、朋友圈和电子商务服务。我们已经在 https://github.com/Tencent/WeMM-Embedding 发布了模型权重和代码,以方便将来的研究。