论文

从头开始扩展本机多模式 预训练

Scaling Native Multimodal Pre-Training From Scratch

模型训练预训练

摘要

尽管大语言模型(LLM)表现出卓越的推理能力,但它们对纯文本预训练的依赖限制了对多模态物理世界的感知。原生多模态 预训练 通过在多模态输入上从头开始训练模型来避免这种限制,从而实现深度跨模态集成并减轻传统后期融合架构固有的优化不对称性。尽管有这些优点,但这种范式的扩展特性仍然没有系统地表征。为了解决这一差距,我们研究了在固定计算预算下训练基于 Transformer 的视觉语言模型的最佳模型大小和标记数量。我们证明,最小的客观损失遵循可预测的计算定律,而计算最优模型大小和词元计数则按幂律缩放。值得注意的是,语言和多模态目标表现出不同的缩放行为。语言分配规律对于数据的组成在很大程度上是不变的,这表明无论多模态数据比例如何,语言学习都是稳定的。相反,多模式分配法则对此成分高度敏感。具体来说,文本密集的混合只有在较大的模型规模下才会变得计算高效,从而将最佳资源分配转向更大的模型容量。此外,通过对数据组成对计算法则和分配指数的影响进行建模,我们得出了一个效率前沿,指定了模型大小、词元计数和数据混合的精确配置。下游评估进一步表明,原生多模态 预训练 会诱导积极的跨模态迁移,从而增强纯文本空间推理并实现强大的多模态上下文学习。总之,这项实证研究为可预测地扩展多模态基础模型奠定了必要的基础。