论文

可验证奖励能否教会视频语言模型理解时间?一项受控多模型研究

What Do Verifiable Rewards Teach Video-Language Models About Time? A Controlled Multi-Model Study

模型评测模型行为与机制分析

摘要

可验证奖励强化学习(RLVR)已显著提升语言模型的推理能力,可验证视频基准也使它能够用于因果与时间关系的视频问答。我们研究 RLVR 究竟教会视频语言模型哪些时间知识。我们使用组相对策略优化微调四个开放模型(Qwen3-VL-8B/4B、Qwen2.5-VL-7B、Gemma-3-12B),比较三种数据配方:可验证数据(具有精确答案与事件顺序奖励的合成 CLEVRER 问题)、不可验证数据(43,751 段真实网络视频上的自监督辅助任务)以及二者按 1:1 混合;另设可验证数据加真实视频的实验组,增加 4,000 道真实视频可验证问题。每个实验配置都在域内数据及域外真实视频上评估,后者包括 NExT-QA 时间压力测试集和 MVBench 子集,并分别使用顺序帧、打乱帧和无帧输入。(1)可验证训练带来较大的域内收益,但基础能力越强,收益越小:较弱模型提高 14—19 个百分点,最强模型提高 6 个百分点。(2)许多收益并非来自视觉:无帧准确率的提升几乎与有帧情况相当。(3)只使用合成可验证数据可能严重损害域外准确率,而训练过程没有显露征兆:Qwen3-VL-8B 在两个真实视频集上分别下降 26.7 和 25.2 个百分点;混合配方没有显著降低任何受训模型的表现。加入真实视频可验证问题后,这种损失消失,下降仅为 2.3 个百分点,处于基础模型的噪声范围内,同时保持 9.3 个百分点的域内增益。因此问题在于狭窄的纯合成数据,而非可验证性本身。(4)没有一种配方使模型真正依据时间顺序作答:尽管使用了事件顺序奖励,41 项评估中有 39 项的顺序帧与打乱帧差距无法与零区分,另外两项也只有微弱差异。可验证奖励可以提高基准准确率,却不一定带来时间理解。应报告无帧对照,并混入真实视频,防止域外退化。