论文

CollabVR:使用视觉语言和视频生成模型进行协作视频推理

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

智能体系统Agent 协作

摘要

最近的“用视频思考”方法使用视频生成模型(VGM)通过生成时间连贯的帧链作为推理工件来进行视觉推理。然而,即使是强大的 VGM,在目标导向任务上也会表现出两种重复出现的故障模式:多步骤任务上的长范围漂移和复合的中间剪辑模拟错误。两者都源于缺乏建立在 VGM 短视界视觉先验基础上的明确推理,视觉语言模型 (VLM) 自然地填补了这一角色,但将 VLM 放置在何处并非易事:在生成任何帧之前就提交了前期计划,而对整个视频的事后批评则干预得太晚。我们提出了 VLM-VGM 协作视频推理(CollabVR),这是一个闭环框架,它将 VLM 与 VGM 在步骤级粒度上耦合:VLM 计划立即执行的下一个操作,检查 VGM 生成的剪辑,并将验证者的诊断直接折叠到下一个操作提示中以修复检测到的故障。在 Gen-ViRe 和 VBVR-Bench 上,CollabVR 相对于单一推理、Pass@$k$ 以及匹配计算的先前测试时间扩展基线,改进了开源和闭源 VGM,在最困难的任务上获得了最大的收益。它还在推理微调的 VGM 之上产生了进一步的改进,表明步进级 VLM 监督与面向推理的 微调 正交并可堆叠。我们在项目页面提供视频样本和其他定性结果:https://joow0n-kim.github.io/collabvr-project-page。