论文
Flash-BoN:扩散模型中推理时间缩放的即时草稿
Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
摘要
文本到图像生成的推理时间缩放已经从简单的 Best-of-$N$ (BoN) 采样发展到在中间去噪步骤验证和引导候选轨迹的引导搜索方法。这些方法侧重于去噪期间验证的时间和频率,但很大程度上将生成成本本身视为固定的。此外,通过函数评估 (NFE) 数量比较方法的标准做法仅计算去噪前向传递,而忽略验证器开销,这可能会扭曲效率排名。我们表明,在挂钟评估下,简单的 BoN 已经匹配或优于几种引导搜索技术,这表明计算最好花在更广泛的探索上,而不是重复的中间验证上。这激发了 Flash-BoN,它通过将三个互补的加速旋钮(时间步截断、层跳跃和激活代理)组合到每个模型优化一次的单个配置中,生成大量廉价的候选草案。然后,高效的多阶段验证程序会确定最有希望的草案,并以最高质量进行完善。在三个基准测试和三个模型规模中,Flash-BoN 始终优于固定挂钟预算下的所有基准,并且收益随着模型规模的增大而增长(+8% AUC)。我们进一步表明,我们的策略结合得很好,并改进了现有的正交技术,例如基于反射的提示优化(+16% AUC)。这些收益与候选多样性的增加相关,这也使得草案引导选择能够加速 RL 后训练 收敛。