Video-HopChain:视频推理模型的多跳问题和置信门控探索
Video-HopChain: Multi-Hop Questions and Confidence-Gated Exploration for Video Reasoning Models
摘要
HopChain 在静态图像上表明,多跳数据合成可以改善视觉语言推理,因为长链思维推理会暴露跨步骤复合的错误,而大多数用于具有可验证奖励的强化学习 (RLVR) 的数据很少需要视觉证据链,因此这些弱点很可能不会暴露。我们在视频中观察到同样的问题,但该框架尚未被探索。因此,我们构建了 Video-HopChain,这是一个包含 13,378 个视频的 22,550 个多跳视频问题的数据集,以及 1,000 个问题的保留基准。每个问题都链接着关于一个视频中的时刻的三到六个是/否问题,每个问题根据其答案产生两个整数之一。最终答案是这些整数的总和,因此该总和的精确匹配给出了 RLVR 所需的可验证奖励。我们首先在标准视频数据集上使用 GRPO 训练 Qwen3-VL-8B,然后在 Video-HopChain 上的第二阶段将八个视频理解和推理基准的平均值从 55.4 提高到 57.9,并改进每一个基准。然而,在这样的数据集上进行训练暴露了 GRPO 的一个已知局限性:它的学习信号来自组内的奖励方差,因此,其采样轨迹全部不正确的难题和采样轨迹全部正确的简单问题都会使该组没有梯度。为了以相同的计算预算恢复这些组,我们引入了置信门探索(CGE)。每个问题有 8 次展示,CGE 像往常一样对前 4 个问题进行采样。如果这 4 个全部正确或全部错误,它会在推理范围内使用策略最有信心的标记对最后 4 个进行采样,并从损失中删除被屏蔽的位置,同时所有 8 个采样轨迹都进入优势。通过 CGE,平均值进一步上升至 59.3。我们发布数据集、检查点以及数据生成和训练代码。