论文

视频语言模型何时不再看视频?奖励强度控制多模态RLVR中视觉捷径的形成与逆转

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

模型评测模型训练强化学习模型行为与机制分析RLVR

摘要

具有可验证奖励的强化学习 (RLVR) 越来越多地应用于大型视觉语言模型 (LVLM),但仅结果优化可能会导致模型停止关注视频,转而利用语言先验——我们将这种失败称为视觉捷径。虽然这种感知旁路的存在现已被记录下来,但它是如何形成的,是否可以撤销,以及何时干预仍然有助于保持开放。我们将锚定惩罚的强度 lambda 视为控制旋钮,并表征沿训练时间轴的视觉捷径的形成反转动态。在保留的、分布外的诊断集上,我们发现:(i)急剧开始——捷径依赖在优化步骤的狭窄窗口中突然出现,并且在随机种子中具有鲁棒性; (ii) 单调剂量反应——增加 lambda 逐渐抑制捷径,在中间剂量时,轨迹首先形成捷径,然后反转捷径,在获取和消除捷径之间暴露出类似滞后的不对称性; (iii) 一个关键的干预窗口——在发病前施加惩罚可以形成捷径,而在巩固后施加相同的惩罚则效果明显较差。这些结果共同将视觉捷径崩溃重新定义为一个可控的、时间相关的和不对称的过程,而不是一个二元缺陷,对何时以及如何强烈地正则化多模态 RLVR 具有直接影响。

视频语言模型何时不再看视频?奖励强度控制多模态RLVR中视觉捷径的形成与逆转:论文配图
图 1:发病真实且种子稳健。在保留的 OOD 数据上,两个独立的种子在同一狭窄的步骤窗口中表现出重叠、急剧上升的 VHS\mathrm{VHS} 曲线,表明出现了视觉快捷方式转换,而不是记忆伪影。