论文

NeoMME:用于高效 微调 和推理的单塔多模态本地多语言基础编码器

NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference

模型训练预训练

摘要

多模态模型通常建立在为生成视觉语言建模而设计的架构上,通常将单独预训练的视觉编码器与因果语言模型相结合。 ColPali 等可视化文档 检索器 将这些模型重新用作编码器,为非生成任务传递 VLM 的参数和计算开销。我们推出 NeoMME,这是一个 260M 和 800M 参数多模式和多语言双向编码器系列,可在单个双向 Transformer 编码器中处理多语言文本和原始图像块。这两个模型都是使用蒙版离散扩散文本目标从头开始进行预训练的,以多模态示例的可见图像块为条件。两者都支持 16,384 个词元上下文,足以编码最多两个标准 4K UHD 图像。为了展示其下游功能,我们通过联合训练的密集和后期交互头对 NeoMME 进行微调。在 ViDoRe v3 基准测试中,生成的 NeoMME-检索器 260M 优于所有严格低于 800M 参数的评估模型,nDCG@10 为 0.523,而 NeoMME-检索器 800M 达到 0.556。在 NVIDIA L40S 上匹配 2048x2048 图像输入尺寸时,NeoMME-260M 对页面进行编码的吞吐量约为 ColModernVBERT 的 2 倍。分层词元池和非对称量化将后期交互多模态文档嵌入压缩了 255 倍,同时保留了超过 95% 的基线 nDCG@10。我们将 NeoMME 贡献给 Hugging Face Transformer,并在 Apache 2.0 下发布了预训练的主干和检索兼容的检查点:https://hf.co/collections/Hcompany/neomme。