论文
在前沿范围内安装视觉适配器
Fitting Vision Adapters at Frontier Scales
摘要
训练是一种介于冻结视觉编码器和语言模型之间的小型投影仪,是一种既定的多模式学习方法。随着参数语言模型数量的急剧增加,我们重新审视这种方法可以添加哪些视觉功能,同时保持其预训练权重固定。在这里,我们将 50M 参数投影仪从 Kimi K2.6 的视觉编码器训练到 GLM 5.2 和 5.3,这两种模型都没有原生视觉功能,并进一步为训练这些适配器提供了大规模的可重复配方。我们研究以下内容:(a)多模态模型的视觉能力如何作为纯粹的语言模型侧尺度进行扩展,以及(b)哪些特定的视觉能力能够大规模地融入到纯语言模型中,哪些仍然受到限制。我们对 MMMU-Pro 和 BLINK 进行评估,检查整体性能和单个视觉任务的结果。
