论文

通过基于扩散的视频推理的自洽学习

Learning via Self-Consistency for Diffusion-based Video Reasoning

模型推理测试时计算扩展

摘要

视频生成模型已经展示了用于视觉推理、感知和其他视觉任务的新兴零样本功能。然而,基于扩散的视频生成本质上是随机的,而许多下游视觉任务是确定性的。受大语言模型思想链推理中自我一致性有效性的启发,我们研究了自我一致性是否可以类似地改善基于扩散的视频推理。我们首先引入一种免训练的测试时计算扩展方法,该方法对多个视频生成进行采样并通过自一致性聚合它们的预测。具体来说,我们将从多次部署中提取的路径、位置或掩码聚合成共识预测。为了减少多次rollout生成的推理开销,我们在去噪轨迹的早期读出预测,这在保持共识质量的同时将去噪步骤减少了一半以上。我们进一步提出拒绝微调(RFT),将共识预测提炼到视频生成模型中。由此产生的模型内化了多样本一致性的好处,并且在推理时只需要单代,同时大大优于原始模型。对迷宫求解、视觉搜索和引用分割等三项任务的实验表明,我们的自洽推理和共识蒸馏都极大地改善了基于视频的感知和推理,而无需地面实况视频或特定于任务的验证。对于视觉搜索,自我一致性将任务准确率从单代的 48.4% 提高到 99.0%。精炼模型通过一次rollout保留了大部分共识优势。对于 4×4 迷宫求解,基于共识的训练在相同的推理延迟下将单代严格成功率从 72.0% 提高到 84.0%。