论文

更少的数据,更好的时机:时态视频grounding中 VLM 按策略蒸馏的学生与课程耦合

Less Data, Better Timing: Student-Curriculum Coupling for VLM On-Policy Distillation in Temporal Video Grounding

摘要

在策略蒸馏 (OPD) 直接对学生生成的轨迹提供密集监督,使其成为时态视频基础 (TVG) 中视觉语言模型的有效后训练策略。然而,现有的流程通常从固定的教师和初始学生状态构建训练课程,隐含地假设所选示例在整个优化过程中保留积极的监督价值。我们表明,监督可信度和监督必要性是截然不同但又相互关联的:前者涉及目标可信度,而后者则随学生当前任务能力而变化;它们共同塑造监督价值。基于这种耦合视图,我们引入了学生-课程耦合(SCC),这是一个闭环框架,其中紧凑的锚定前沿课程定义了候选人监督空间,而不断发展的学生动态地确定其活跃子集。因此,随着能力的变化,监督可以被激活、暂停或重新激活,从而将教师的计算和优化集中在当前任务级别的缺陷上。在三个 TVG 基准中,SCC 在其原始课程中的平均召回率比 Video-OPD 提高了 5.1%,同时使用的训练示例减少了 60.0%,训练时间减少了 50.4%。消融支持能力结构的课程设计和学生依赖的监督在实现这些成果方面的互补作用。总之,这些结果将 SCC 确立为 TVG 训练后的数据和计算高效框架,通过将值得信赖的监督与学生不断变化的学习需求结合起来,提供更强大的时间基础。