论文
视觉语言适应中的文本能力损失:注意力下沉诊断
Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis
摘要
微调 将 LLM 预训练为视觉语言模型 (VLM) 会削弱主干网的文本能力,损害集中在需要遵循精确输出规则的任务上,例如指令遵循、根据严格解析的最终答案进行的思想链推理以及严格评分者的类似评估。我们将这一差距追溯到注意力接收器损坏:VL 微调 扰乱了锚定大部分注意力概率的早期接收器位置,并且基础 LLM 保留其接收器的程度跟踪了有多少受影响的能力在适应中幸存下来。基于这个观点,我们引入了 Sink Strength,这是一个在单个 GPU 上在几秒钟内在 LLM 上计算出来的单个标量,可以预测 VL 后的退化,而无需任何 VL 训练。它持续跟踪六个 VLM-LLM 对和多个格式敏感任务的相对退化。作为对这一诊断的补充,我们发现预训练后 QK-RMSNorm 注入无法重现本机 QK-RMSNorm 的保护,而一些现成的权重合并设置无法恢复 VL 训练后丢失的能力。这些负面结果强调了在 VL 训练之前用 Sink Strength 筛选骨干的价值,并缩小了头部选择性训练时间保护的干预空间。