论文
无需训练 流匹配图像生成器的隐藏状态细化
Training-Free Hidden-State Refinement for Flow-Matching Image Generators
摘要
我们的目标是通过在降噪器内部添加推理计算来改进冻结流匹配图像生成器,而不改变模型权重或外部采样器。现有的生成器通常通过增加采样步骤数来花费额外的测试时间计算,这会重复评估整个降噪器并将质量增益与采样器成本结合起来。一个关键的挑战是如何在冻结的 Transformer 降噪器中使用额外的计算:该方法必须决定哪些标记、层和采样时间接收重复更新,同时保留原始生成管道。我们引入了一个 无需训练 循环框架,该框架在每个去噪调用中重复应用选定的 Transformer 层。密集和稀疏词元循环改变词元范围;采样进度门控和循环层范围指定循环何时何地处于活动状态;循环计数和强度控制重复更新;循环引导结合了普通矢量场预测和循环矢量场预测。在两个 Scale-RAE 模型尺度中,循环变体通过具有竞争力的质量-效率权衡来改进主要和辅助质量指标。 Loop Guidance 进一步改进了所有三个测试模型的两个主要指标;在 Scale-RAE DiT2.4B 上,它将 GenEval 从 0.4471 提高到 0.5691,将 DPG-Bench 从 0.7656 提高到 0.8053。代码将被发布。