论文

CachedSearch:面向视频扩散测试时搜索的免训练缓存探索

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion

模型推理测试时计算扩展

摘要

测试时搜索让小型视频扩散模型能与更大的模型抗衡,但成本高出2-10倍。所有候选都被完整去噪,尽管其中大多数会被丢弃。免训练缓存使每次rollout提速2-3倍且质量近乎无损。只有当有损缓存能保持验证器的排名时,二者组合才是安全的。我们首次研究缓存是否会破坏视频测试时搜索中的候选排名。在Wan2.1-T2V-1.3B上使用自适应缓存封装(每个候选约2倍加速),用ImageReward为种子匹配的缓存rollout与完整rollout打分。每提示的Spearman秩相关中位数为0.905,在VBench套件上top-1一致率为72%。VBench-2.0在更难的套件上复现了这一结果。以完整计算重算缓存选出的优胜者,可保留完整搜索收益的90-94%。错误集中在接近并列的候选之间,使损坏具有自限性。这一发现催生了CachedSearch。它以激进缓存探索每个候选,然后只用完整计算重新生成优胜者。在N=8时,它以63%的成本捕获best-of-N收益的94.7%。捕获率随搜索宽度上升。在相同预算下,它搜索两倍宽度并获得多38%的收益。该结论在1.3B到14B的六个模型、四个家族上成立:Wan、LTX、CogVideoX与Hunyuan。Wan2.1-14B保持了与1.3B模型相当的保真度。轨迹中段剪枝把探索节省倍增至3.11倍,捕获率为88.6%。移植到其他模型家族只需重新校准单一参数,表明保真度取决于架构而非参数量。CachedSearch免训练、与验证器无关且与搜索算法正交,是测试时扩展的即插即用倍增器。

CachedSearch:面向视频扩散测试时搜索的免训练缓存探索:论文配图
图 2:CachedSearch 概述。缓存每个候选人,对草稿进行评分,然后在完全计算时重新生成获胜种子。