论文
Video-MOPD:用于视频理解的多教师 同策略 蒸馏
Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding
摘要
视频理解需要融合感知、时间理解和复杂推理的互补能力,而这些能力很难在单个模型中联合优化。 We introduce Video-MOPD-8B, an open-weight model dedicated to video understanding tasks.为了从根本上增强其能力,我们在三个核心领域进行了有针对性的强化学习(RL)优化:视频时间基础(VTG)、一般视频理解和视频 STEM 推理。然后,我们通过多教师 同策略 蒸馏 (MOPD) 统一他们的互补能力,通过路由教师反馈来监督学生生成的轨迹,从而巩固专家知识。我们进一步引入了可靠性感知信息抽样(RAIS),它选择具有始终可靠的教师监督和较大的师生表现差距的示例。这些组件共同使 Video-MOPD-8B 能够在不同的视频理解任务中实现协调和全面的性能提升。对涵盖一般视频理解、时间基础、视频推理和视频 STEM 任务的综合基准进行的广泛实验表明,Video-MOPD-8B 在可比规模的现有模型中实现了最先进的性能。 The trained model weights are available at https://huggingface.co/LandH/Video-MOPD-8B.