论文

多中少:从密集参考中强化稀疏视频推理

Less from More: Reinforcing Sparse Video Reasoning from Dense References

模型训练强化学习

摘要

视频语言模型通常假设更多的时间观察会导致更可靠的推理。我们质疑这一假设,并认为关键挑战不仅在于有效地处理更多视频帧,还在于学习在有限的时间证据下进行可靠的推理。我们提出了 SAVER,一种从密集到稀疏的后训练框架,它使用密集视频视图作为稀疏帧推理的训练时参考。在强化训练后,配对的密集和稀疏视图通过基础奖励和可靠性门控参考奖励进行优化,鼓励稀疏视图预测以保留与任务相关的时间证据。值得注意的是,SAVER 仅在 1,250 个随机采样的时间基础示例上进行训练,没有使用任何视频问答注释。在三个时间基础基准和六个视频问答基准中,SAVER 持续提高了跨帧预算的性能。特别是,SAVER 可以匹配或超越密集帧 Qwen3.5 基线,同时使用更少的帧。这些结果表明,时间 接地可以作为学习稀疏视频推理的有效证据定位代理,从而转移到更广泛的视频理解任务。