论文

用于视频推理的帧差分同on-policy自蒸馏

Frame Differential On-Policy Self-Distillation for Video Reasoning

摘要

强化学习(RL)通过可验证的奖励和越来越细粒度的视觉或时间信用分配,极大地提高了多模态语言模型的推理能力。然而,在视频推理中,当前的强化学习方法通常使用固定的稀疏帧预算进行训练:增加帧数会使自回归部署成本高昂,而帧数太少可能会错过时间局部事件和细粒度的视觉细节。我们提出了 帧差分同on-policy自蒸馏(FD-OPSD),它在 RL 训练期间将密集帧观察的有用证据转移到稀疏帧策略。 FD-OPSD 比较稀疏和密集视图下相同采样响应的策略词元级别偏好,并在没有外部教师或密集自回归rollout的情况下提取所得的帧差分信号。该方法保留了稀疏帧的rollout并使推理保持不变。在六个视频推理基准测试中的 Qwen2.5-VL-7B 和 Qwen3-VL-4B 中,FD-OPSD 在 16、32 和 64 帧评估设置中比最强的相应 GRPO、T-GRPO 或 Video-KTR 基线产生更高的总体平均性能。这些结果表明,密集的视觉证据可以在训练期间通过词元级别的自蒸馏选择性地转移,同时保留稀疏的帧rollout和不变的推理。