论文
投影仪就是您训练的全部
Projector Is All You Train
摘要
多模态 大语言模型 (MLLM) 的典型训练过程涉及调整语言模型主干以及主干和特定模态编码器之间的投影仪。我们询问 微调 MLLM 的骨干是否有必要使其适应新的模式。通过 3D MLLM 的实验,我们发现仅训练投影仪就足以实现相对于现有基线模型和我们联合训练的具有相同编码器和主干的 MLLM 的强大多模态性能。我们还表明,联合训练会导致语言模型现有功能出现不良漂移,而仅投影仪训练根据定义可以避免这种情况。此外,仅投影仪训练的训练样本吞吐量大约是联合训练的两倍。我们通过 3D 分类和字幕基准以及评估语言、视觉和空间推理能力的标准基准在不同的语言模型主干上验证我们的发现。