论文

通过图像编辑的早期潜在验证实现自适应推理时间缩放

Adaptive Inference-Time Scaling via Early-Step Latent Verification for Image Editing

模型推理测试时计算扩展

摘要

随着生成模型的最新进展,基于指令的图像编辑取得了显着进展。然而,编辑结果的质量仍然受到随机采样的初始噪声的影响,尤其是在复杂的编辑场景中。不合适的初始噪声可能会导致编辑结果不令人满意。最近的推理时间缩放方法通过对多个初始噪声进行采样并选择更好的候选者来解决这个问题。然而,它们中的大多数遵循解码然后验证的方案,该方案引入了效率与准确性的权衡。当在有限的推理步骤之后执行解码时,解码的图像通常对于可靠的评估而言噪声太大,而充分去噪的图像需要更高的计算成本。为了解决这个问题,我们提出了 VeriLatent,一种即插即用的自适应推理时间缩放框架,具有用于图像编辑的早期潜在验证。具体来说,我们提出了一种新颖的验证器,可以在早期阶段通过潜在空间编辑激活图对每个初始噪声进行评分。它通过评估是否可以在正确的区域诱导有效的编辑来识别有前途的候选者。这可以实现高效的早期修剪,而无需将潜在图像解码为图像。在此基础上,我们进一步开发了一种用于推理时间缩放的自适应搜索策略。它根据编辑难度分配推理预算,从而减少功能评估(NFE)的数量。对多个基准和不同基础模型的大量实验表明,VeriLatent 持续提高了编辑性能和推理时间扩展效率。