论文

迷失适应:视频语言模型中时间推理的层选择性恢复

Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models

模型优化模型合并

摘要

多模态适应会削弱视频语言模型 (VLM) 中的时间推理 (TR),使模型能够感知显着事件,但无法推断其时间和因果结构。我们引入了 MERIT,一个无梯度框架,它通过层选择性模型合并来修复此功能。 MERIT 为每个自注意力层分配一个 VLM 主导或 LLM 主导插值,并使用协方差矩阵适应进化策略 (CMA-ES) 在奖励 TR 增益同时惩罚时间感知 (TP) 退化的目标下搜索结果组合空间。在三个 VLM 系列和五个视频基准测试中,MERIT 不断提高 TR,同时保持 TP;在紧凑型诊断装置上选择的食谱转移到四个看不见的基准,相对收益高达 27.8%。干预性掩蔽和帧级归因进一步表明,所选层对于推理来说在功能上很重要,并且 MERIT 将决策转向时间分布的、因果相关的证据。这些结果将层选择性合并作为一种实用的事后机制,用于修复多模态适应过程中退化的视频时间推理,而无需学习新参数。