论文
深入研究低秩视觉语言对齐的隐性偏差
Dive Into the Implicit Biases of Low-rank Vision-language Alignment
摘要
视觉语言对齐是连接预训练视觉编码器和 大语言模型 的阶段,被广泛视为需要全参数更新的预训练形式。我们挑战这种观点,并研究在此阶段将低秩适应应用于 LLM 时会发生什么。我们发现低秩对齐不仅降低了计算成本,而且在大多数基准测试中优于全参数对齐。为了理解这种现象,我们系统地描述了对齐过程中低秩适应引入的隐式偏差。根据经验,我们发现低秩对齐将模型行为从幻觉转变为保守,并保留了全参数对齐破坏的视觉特征的每个标记的线性可分离性,我们将这种现象称为 LS 诅咒。从几何角度来看,低秩对齐模型表现出更同质且结构稳定的视觉表示,保持特定于模态的知识,而不是过早地融合实体级语义。从理论上讲,我们建立了两个定理,表明低秩对齐会导致对具有平坦梯度的参数子空间和对扰动具有鲁棒性的特征子空间的偏好,为观察到的结构保持行为提供了原则性的解释。广泛的实验涵盖了超过 100 种对齐配置、三个低秩算子系列以及各种秩、编码器和其他设置。