论文

看哪里很重要:同策略 Self-蒸馏 用于长视频理解

Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

摘要

视觉语言模型 (VLM) 在长视频理解方面取得了实质性进展,标准主干模型通常可以回答整个视频中采样帧的问题。然而,随着视频变得更长,完整视频上下文不可避免地包含更多与问题无关的时间内容,这可能会分散模型对回答特定问题所需的证据的注意力。我们凭经验发现,与使用相应的完整视频相比,将视觉输入集中在包含问题相关证据的短注释线索间隔上,可以持续提高模型规模的预测准确性,同时需要更少的输入帧。基于这一发现,我们引入了 Clue-OPSD,一个用于长视频理解的线索特权 同策略 自 蒸馏 框架。在训练过程中,全视频学生通过沿着学生生成的轨迹对齐下一个标记分布,以相应的线索间隔为条件,向自学教师学习。因此,Clue-OPSD 使用线索间隔作为特权监督,而不依赖于 真值 答案标签,同时在推理时不需要线索注释或附加模块。跨多个长视频理解基准和 Qwen3.5 模型规模的广泛实验证明了相对于相应主干模型的一致改进以及相对于监督 后训练 基线的强大性能。