论文
ScAle:注意力头缩放作为视觉语言模型中空间推理的最小适配器
ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models
摘要
对于许多视觉语言模型 (VLM) 来说,空间推理仍然是一个持续的挑战,而改进它通常需要 微调 和大量附加参数。我们的初步分析表明,在不修改预训练权重的情况下,重新调整选定 Transformer 层中的激活可以显着影响下游性能。受这一观察的启发,我们提出了 ScAle,这是一种超轻量级适应方法,它学习一小组标量系数来调节完全冻结的主干中的最后一个词元注意力和 MLP 激活。我们在合成空间推理基准 SpatialEval 和跨多个模型系列的真实 VQA 数据集(COCOQA 和 VGQA)上评估我们的方法。我们的方法 ScAle 仅使用 1K 个可训练参数即可实现高达 134.1% 的相对准确度增益,而无需像 LoRA 等标准 PEFT 方法那样需要数百万个可训练参数。尽管其极其紧凑,我们的方法恢复了标准 PEFT 性能的很大一部分,同时保持了强大的非空间 VQA 准确性。这些结果表明,有界激活重新加权为适应预训练的 VLM 提供了一种简单、与架构无关且参数高效的替代方案。