论文

PG-MAP:用于扩散和流匹配模型的推理时间对齐的联合 MAP 优化

PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models

模型推理解码与生成控制

摘要

预训练文本到图像模型的推理时间对齐通常沿着单个控制轴执行,例如无分类器引导、注意力编辑或基于奖励的潜在扰动。这种限制阻止了对条件变量和潜在变量之间的联合依赖关系进行建模,并阻碍了跨生成传输的传输。我们提出 PG-MAP,一个 无需训练 框架,通过前向一致性耦合将推理时间对齐制定为轨迹级 Gibbs-MAP/条件 $c$ 和潜在状态 $z_t$ 上的近端能量优化,可选地由冻结偏好奖励引导。这种联合制定可以实现跨模式的协调更新,同时通过特定于运输的适应来保持与扩散和流量匹配模型的兼容。在扩散主干网(SD~1.5、SDXL)中,PG-MAP 持续改进了 PickScore 和 Aesthetic 等对齐指标,并且可以与经过调整的无分类器指导有效结合,以实现最强的整体性能。在流匹配模型 (SD3.5-medium) 上,该框架简化为仅潜在变体,相对于静态基线实现 $\mathbf{91.9\%}$ PickScore 和 $75.7\%$ HPS 获胜率,并通过受控实验排除了与噪声相关的伪影。人类评估进一步证实了对强基线的一致偏好,包括调整的 CFG 和计算匹配的通用指导。最后,预言机路由分析表明,调节和潜在优化的相对重要性取决于提示类型,从而为每个提示选择器提供了可以利用的进一步空间。