论文

在前沿范围内安装视觉适配器

Fitting Vision Adapters at Frontier Scales

模型训练参数高效训练

摘要

训练是一种介于冻结视觉编码器和语言模型之间的小型投影仪,是一种既定的多模式学习方法。随着参数语言模型数量的急剧增加,我们重新审视这种方法可以添加哪些视觉功能,同时保持其预训练权重固定。在这里,我们将 50M 参数投影仪从 Kimi K2.6 的视觉编码器训练到 GLM 5.2 和 5.3,这两种模型都没有原生视觉功能,并进一步为训练这些适配器提供了大规模的可重复配方。我们研究以下内容:(a)多模态模型的视觉能力如何作为纯粹的语言模型侧尺度进行扩展,以及(b)哪些特定的视觉能力能够大规模地融入到纯语言模型中,哪些仍然受到限制。我们对 MMMU-Pro 和 BLINK 进行评估,检查整体性能和单个视觉任务的结果。

在前沿范围内安装视觉适配器的原论文方法或结果图
图 4:logit 镜头很早就读取到到处都是“草”,而雅可比矩阵镜头则从第一层看到狗。顶行:对于每个图像token,以五个深度(GLM,743B)覆盖在图像上的“狗”和“草”之间的每个补丁获胜者。底部:狗斑块的分数每层读为“狗”(草斑块在雅可比矩阵镜头下始终保持“草”状态,为 0.7-0.9)。草标签使用颜色启发法;基于掩模的控制如附录图 10 所示。