论文
ProAR:自回归视频模型学习前瞻推理
ProAR: Learning Prospective Reasoning with Autoregressive Video Models
摘要
自回归(AR)视频模型擅长因果生成,但其对下一chunk预测的依赖把它们局限于短视、反应式的范式。这一局限对面向推理的生成尤其致命——通过有效中间状态达成目标结果比局部视觉合理性更重要。为此我们提出ProAR——把自回归视频生成转变为目标导向推理过程的新框架,含两组件:(1)为把生成锚定到长程结果,经非对称注意力掩码把目标帧预测整合进自回归循环,使预测的目标帧引导中间状态生成而不被其扰动;(2)为引导短程转移,引入未来表征自对齐——鼓励当前隐状态预期即将到来的时间动态;借AR训练中的教师强制,单次前向提取干净的未来表示,并以仅训练的轻量预测器对齐当前表示。两机制无缝结合显式稀疏的目标监督与隐式稠密的逐步引导,以适度计算成本促成连贯的目标导向推理进展。实验显示ProAR的互补组件跨多样视觉推理基准一致改善性能;框架训练高效——仅用25%训练步即超越全训标准AR基线。该范式对具身推理任务也展现出有前途的适用性。