论文

VideoLatent:通过潜在自我强迫进行视频语言学习

VideoLatent: Video-Language Learning via Latent Self-Forcing

模型推理推理策略与问题分解

摘要

思想链 (CoT) 推理的最新进展在增强多模态 大语言模型 (MLLM) 的视频理解和推理能力方面显示出了希望。然而,现有的基于 CoT 的 MLLM 需要劳动密集型的 CoT 注释,并会产生大量的训练和推理开销。虽然视觉潜在推理已成为一种更有效的替代方案,但现有方法主要关注图像任务,并严重依赖额外的监督信号来进行视觉潜在生成(例如,CoT 轨迹、辅助图像或细粒度注释),从而限制了它们对视频任务的可扩展性和可转移性。为了弥补这一差距,我们引入了 VideoLatent,这是一种新型 MLLM,配备了专为视频理解和推理而定制的潜在注入模块。具体来说,VideoLatent 学习使用新的潜在自我强迫训练范例来执行视觉潜在推理,该范例包括潜在对齐和潜在多样性目标,并且仅依赖于标准视频-问题-答案三元组。跨 14 个基准的广泛实验表明,我们的模型在一般视频理解和复杂视频推理方面始终优于现有标准和潜在 MLLM。与Video-R1相比,我们的VideoLatent实现了卓越的计算效率,将训练/推理开销减少了$\sim$6$\times$/$\sim$68$\times$。此外,实验表明我们的方法对不同的 MLLM 主干和不同的模型规模具有很强的通用性。