论文
在预测之前先想象:用于视频事件预测的交错潜在视觉推理
Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction
摘要
视频事件预测(VEP)需要模型从部分视频证据中推断出未观察到的未来状态。现有的视频 MLLM 通常在文本空间中用语言表达中间未来推理:一旦用语言表达视觉证据,细粒度的运动、几何和交互线索可能会丢失,导致看似合理但在视觉上毫无根据的幻觉。我们引入了 Future-L1,这是一种交错的潜在视觉推理框架,可让 MLLM 在自回归解码期间在语言标记和连续潜在视觉跨度之间交替。为了训练这种能力,我们通过选择未来视觉提示有助于预测并将潜在状态与未来帧嵌入对齐的示例来构建 Future-L1-50K,然后使用 LA-DAPO(一种具有结果对比和时间多样性奖励的潜在感知 RL 目标)进一步优化采样的潜在轨迹。 Future-L1 在两个基准测试中均取得了最先进的成绩:在 FutureBench 上,它将 Qwen3-VL-8B 从 61.0 提高到 85.4,比之前最好的 Video-CoE 提高了 10.4 分;在 TwiFF-Bench 上,它将平均得分从 2.44 提高到 3.04。这些结果表明,面向未来的视频推理受益于在潜在空间中保留中间视觉语义,而不是将每个推理步骤翻译成文本。