论文

语言预训练引起的偏差:一般视觉任务的坚实基础

Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks

模型训练参数高效训练

摘要

语言 预训练 模型和视觉 预训练 模型中异常参数的比例存在显着差异,使得跨模态(语言和视觉)本质上比跨域适应更具挑战性。因此,许多先前的研究都集中在跨域转移上,而不是试图弥合语言和视觉模式,假设语言预训练模型由于不同的参数空间而不适合下游视觉任务。与此假设相反,我们证明添加桥梁训练阶段作为模态适应学习器可以有效地将 大语言模型 (LLM)参数与视觉任务对齐。具体来说,我们提出了一种简单而强大的解决方案随机标签桥训练,不需要手动标记并帮助 LLM 参数适应视觉基础任务。此外,我们的研究结果表明,部分桥梁训练通常是有利的,因为 LLM 中的某些层表现出强大的基础属性,即使没有 微调 进行视觉任务,这些属性仍然有益。这一令人惊讶的发现开辟了直接在视觉模型中利用语言预训练参数的新途径,并强调了部分桥训练作为跨模态适应的实用途径的潜力。