论文
视频语言模型何时不再看视频?奖励强度控制多模态RLVR中视觉捷径的形成与逆转
When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR
摘要
具有可验证奖励的强化学习 (RLVR) 越来越多地应用于大型视觉语言模型 (LVLM),但仅结果优化可能会导致模型停止关注视频,转而利用语言先验——我们将这种失败称为视觉捷径。虽然这种感知旁路的存在现已被记录下来,但它是如何形成的,是否可以撤销,以及何时干预仍然有助于保持开放。我们将锚定惩罚的强度 lambda 视为控制旋钮,并表征沿训练时间轴的视觉捷径的形成反转动态。在保留的、分布外的诊断集上,我们发现:(i)急剧开始——捷径依赖在优化步骤的狭窄窗口中突然出现,并且在随机种子中具有鲁棒性; (ii) 单调剂量反应——增加 lambda 逐渐抑制捷径,在中间剂量时,轨迹首先形成捷径,然后反转捷径,在获取和消除捷径之间暴露出类似滞后的不对称性; (iii) 一个关键的干预窗口——在发病前施加惩罚可以形成捷径,而在巩固后施加相同的惩罚则效果明显较差。这些结果共同将视觉捷径崩溃重新定义为一个可控的、时间相关的和不对称的过程,而不是一个二元缺陷,对何时以及如何强烈地正则化多模态 RLVR 具有直接影响。
