论文
OpenCoF:通过视频生成学习推理
OpenCoF: Learning to Reason Through Video Generation
摘要
推理已成为大型模型的核心功能,尤其是当可靠的决策需要理解逻辑结果时。最近的视频生成模型提供了与之前的思想链 (CoT) 不同的推理路径:推理可以通过时间连接的帧展开,称为帧链 (CoF) 推理。然而,现有的视频生成器主要是在通用视频语料库上进行训练,仍然缺乏多样化的监督和专门的 CoF 推理设计。为了解决这一差距,我们引入了 OpenCoF,一个由 OpenCoF-17K 数据集(涵盖 11 个任务族的推理视频数据集)和 Wan-CoF 组成的框架,Wan-CoF 是一个微调视频模型,用于研究不同的时间监督是否可以改善 CoF 行为。在四个视频推理基准测试中,Wan-CoF 比 Wan2.2-I2V-A14B 基准取得了相当大的进步。在此基础上,我们凭经验探索更先进的 CoF 功能设计,即为模型配备视觉和文本推理标记。该机制分别捕获底层视觉线索和高级语义先验,以进行空间和时间推理。通过性能比较和注意力分析,我们检查这些标记如何在模型深度、去噪步骤、空间和时间方面做出贡献。我们的结果表明,更强的视频推理需要广泛的时间监督和组织中间推理状态的明确机制。我们开源数据集、模型和代码,以促进未来面向推理的视频生成的研究。