论文

VR-JEPA:学习基于生成的视频推理的对比状态潜在指导

VR-JEPA: Learning Contrastive-State Latent Guidance for Generation-based Video Reasoning

模型训练监督微调与指令调优

摘要

通过视频生成进行推理通过对潜在视觉状态及其动态进行建模,为视觉智能提供了一条有前途的途径。然而,当前的视频生成模型通常缺乏关于这些状态如何演变的明确指导,导致生成的轨迹容易出现物理和结构不一致,从而破坏推理可靠性。虽然视频联合嵌入预测架构(V-JEPA)提供了通过潜在预测学习到的丰富的时空先验,但这些一般先验并不能自然地适应复杂视觉任务所需的逻辑推理能力。为了弥补这一差距,我们提出了 VR-JEPA,这是一个框架,通过局部对比状态学习将 V-JEPA 预测器与特定于任务的推理逻辑结合起来,并使用其预测的潜在轨迹来指导视觉推理的视频生成。具体来说,(i)我们将成功的轨迹与相同输入条件下生成的替代方案配对,并利用其 V-JEPA 表示中的差异来识别信息状态和标记,以进行局部对比监督。 (ii) 我们进一步为 V-JEPA 预测器配备了经过锚定任务数据训练的特定技能专家,使模型能够自适应地专门化其跨不同认知领域的共享时空先验。与特定技能的专家一起,这种对比监督使 VR-JEPA 能够预测潜在轨迹,为视频生成提供特定于任务的逻辑指导。对大规模 VBVR-Pro-Bench 数据集的综合实验表明,VR-JEPA 相对于最先进的基于生成的推理基线实现了 $11.33%$ 的相对改进,显着减轻了物理伪影并增强了逻辑一致性。