论文

迈向多模态预训练物理学:知识流、模态协同、早期统一和秘诀

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

模型评测模型行为与机制分析

摘要

视觉为推进基础模型提供了关键轴,推动了向原生统一多模式预训练的转变。尽管有这种势头,但统一训练期间模式相互作用的设计空间和基本机制仍未得到充分探索。我们通过对多模式预训练的系统探索来提供实证清晰度。我们对合成数据集和大规模现实数据集进行的对照实验得出了关于多模态预训练物理学的四个关键见解:(i)知识流:我们解开了语言、视觉理解和视觉生成如何跨模态传递知识,揭示了不同的影响和不对称模式; (ii) 协同与竞争:我们表明,数据“复杂性”在很大程度上决定了模态是否具有协同作用,确定了促进协同作用的架构选择:例如共享注意力和特定模态前馈层的标准化,并发现这些行为可以在不同的视觉分词器设计中泛化; (iii) 早期统一:从早期阶段开始统一模式并联合训练它们比后期调整或顺序训练更有效。这个过程揭示了视觉惰性现象,延迟集成导致模型依赖于语言先验; (iv) 配方:我们推导出高效的预训练配方,仅使用 5% 的计算预算即可实现强大的生成性能。随后,通过在 2T 词元上训练多个 13.5B MoE 模型,这些核心发现得到了大规模验证。我们希望这项研究为理解和扩展多模式预训练提供原则基础。