论文

视频-OPSD:利用视频 大语言模型 中的 同策略 自 蒸馏 的特权视觉证据

Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models

摘要

同策略 self-蒸馏 (OPSD) 最近作为一种有效的 后训练 范式出现,它通过来自特权自学者的密集 词元级 监督来改进策略优化。尽管前景广阔,但视频 大语言模型 (Video-LLM) 的 OPSD 在很大程度上仍未得到充分开发。现有的方法通常通过用附加信息增强上下文来构建特权教师,同时保持教师和学生的主要输入不变。然而,视频推理在主要输入本身内提供了独特的特权监督来源:长视频包含大量的时间冗余,并且只有一小部分帧提供了回答问题所需的证据。基于这一观察,我们提出了 $\textbf{Video-OPSD}$,这是一个 OPSD 框架,它利用特权视觉证据来进行自学构建和知识转移。首先,我们以证据为基础的自学教师只要求老师使用带注释的证据框架,而学生则继续对整个视频进行推理。这种集中的视觉输入使教师能够提供更多信息的监督。其次,我们的证据引导词元优化根据每个推理词元对特权视觉证据的依赖自适应地对 词元级 蒸馏 进行加权,从而强调基于感知的推理。跨视频理解和推理基准的实验表明,$\textbf{Video-OPSD}$ 在多个骨干网络上持续改进标准 OPSD,并实现与 GRPO 相当的性能,同时需要显着减少训练时间,为 Video-LLM 建立有效且高效的 后训练 方法。