论文

VISD:通过结构化自我增强视频推理-蒸馏

VISD: Enhancing Video Reasoning via Structured Self-Distillation

摘要

由于序列级奖励稀疏,并且在长期、基于时间的推理轨迹上缺乏细粒度的贡献分配,训练 VideoLLM 进行复杂推理仍然具有挑战性。虽然具有可验证奖励的强化学习(RLVR)提供了可靠的监督,但它无法捕获 词元级 的贡献,从而导致学习效率低下。相反,现有的自 蒸馏 方法提供密集的监督,但缺乏结构和诊断特异性,并且通常与强化学习不稳定地相互作用。在这项工作中,我们提出了 VISD,一种结构化的自 蒸馏 框架,它为视频推理引入了具有诊断意义的特权信息。 VISD 采用视频感知判断模型将推理质量分解为多个维度,包括答案正确性、逻辑一致性和时空基础,并使用这种结构化反馈来指导 词元级 监督的教师策略。为了稳定地将密集监督与 RL 集成,我们引入了一种方向幅度解耦机制,其中根据奖励计算的采样轨迹级别优势决定更新方向,而结构化特权信号则调制 词元级 更新幅度。此设计可实现语义对齐和细粒度的学分分配,从而提高推理 忠实性 和训练效率。此外,VISD 还结合了课程安排和基于 EMA 的教师稳定性,以支持长视频序列的稳健优化。对不同基准的实验表明,VISD 始终优于强基准,提高了答案准确性和时空基础质量。值得注意的是,VISD 在优化步骤中的收敛速度提高了近 2 倍,从而实现了这些收益,凸显了结构化自我监督在提高 VideoLLM 性能和样本效率方面的有效性。