论文

通过诊断引导的候选者回收来缩放视频扩散模型的测试时间

Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling

模型推理测试时计算扩展

摘要

最近的视频传播模型已经取得了显着的生成质量,但高保真结果仍然在很大程度上依赖于闭源系统或昂贵的大规模基础设施。测试时间缩放(TTS)提供了一种 无需训练 方法,通过花费额外的推理计算来改进轻量级生成器,但现有方法大多保留在噪声搜索范式中:它们采样、选择或扰乱去噪轨迹,并在昂贵的生成后丢弃低分候选。这种生成并丢弃的过程不仅浪费计算,而且浪费已经编码在可恢复样本中的部分运动、布局或外观结构。我们提出了 \textbf{GEARS} (\textbf{G}uided \textbf{E}diting for \textbf{A}daptive \textbf{R}ecycling \textbf{S}earch),这是一个 无需训练 框架,通过生成-评估-编辑循环将此类候选者转化为可编辑先验,将{诊断引导的候选者回收}引入到视频 TTS 中。 GEARS 由两个协作组件组成。 \textbf{Stage-Aware Scheduler} 确定修复什么、何时修复以及应保留、回收或丢弃哪些候选。 \textbf{Candidate Recycler} 从关键帧和多维奖励反馈中诊断可恢复的故障,导出特定于候选者的修复提示,并通过流形感知的潜在 SDEdit 修复相应的候选者。修复后的候选者被回收到搜索池中,创建超出标准噪声扰动的细化路径,同时保留有用的结构。在匹配的 NFE 预算下,GEARS 始终优于 VBench 上现有的视频 TTS 方法,使 1.3B 模型的总分与 14B 模型相当,并且消融验证了自适应调度、诊断条件编辑和流形感知再降噪的必要性。代码可在 GitHub 上获取。