论文
通过输入自适应深度聚合减轻 Vision-Language 微调 中的推理负担
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
摘要
对视觉指令数据进行监督的 微调 (SFT) 通常会提高视觉语言模型 (VLM) 的感知能力,同时降低推理性能,从而在 后训练 期间产生持续的推理负担。我们研究了这种退化是否与深度表示的访问中断有关,并发现即使固定的跨深度聚合也能基本上恢复推理,这表明保留的跨深度访问是 VLM 微调 中一个重要的缺失因素。基于这一观察,我们提出了输入自适应深度聚合(IADA),这是一种轻量级机制,使跨深度检索输入自适应、模态感知,并通过低秩瓶颈进行有效参数化。在 Qwen3-VL-2B 上,与仅使用 LoRA 的 微调 相比,IADA 仅使用 0.14M 附加参数,平均推理得分提高了 9.5 分,平均感知得分提高了 3.3 分,其中最强的增益出现在参数高效的低秩设置中。