论文
深度思维对齐:用于视频推理的轨迹级潜在 蒸馏
Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning
摘要
用于视频推理的大型多模态模型(LMM)长期以来一直受到处理大量视觉信息的高计算成本的阻碍。这种困境促使大型模型的推理能力转移到更小、更高效的模型。 同策略 蒸馏 (OPD) 通过沿着学生生成的轨迹匹配输出词元分布,提供了一个有前途的解决方案。然而,视频推理通常依赖于跨多个帧积累的证据。在这种情况下,输出级监督仅捕获通过词元预测表达的信息,并且不直接约束推理过程中形成的潜在表示。为了解决这个限制,我们提出了 Latent-OPD,它通过轨迹级潜在 蒸馏 来增强 OPD。具体来说,我们的方法侧重于每个轨迹末端的位置,其中隐藏状态有效地总结了积累的视觉证据和推理上下文。此外,我们引入了一种渐进式的教师前瞻策略,它将中后期的学生层与越来越深的教师层结合起来。对六个视频推理基准的实验表明,Latent-OPD 始终优于仅输出 OPD。值得注意的是,在有限帧、长视频或需要复杂证据聚合的任务的场景中,改进尤其明显。这些结果表明 Latent-OPD 是一种高效的帧效率视频推理方法。