论文

Oracle Noise:更快的语义球形对齐,用于可解释的潜在优化

Oracle Noise: Faster Semantic Spherical Alignment for Interpretable Latent Optimization

模型推理解码与生成控制

摘要

文本到图像的扩散模型已经实现了卓越的生成能力,但将复杂的文本提示与合成布局准确对齐仍然是一个持续的挑战。在这些模型中,初始高斯噪声充当决定宏观布局的关键结构种子。最近的在线优化和搜索方法试图细化这种噪声以增强文本图像对齐。然而,依靠无约束的欧几里得梯度上升在数学上夸大了潜在范数并破坏了标准高斯先验,导致严重的视觉伪像,例如颜色过饱和。此外,这些方法的语义路由效率低下,很容易陷入外部代理模型的“奖励作弊”陷阱。为了解决这些相互交织的瓶颈,我们提出了 Oracle Noise,这是一种零样本框架,将噪声初始化重新构建为严格限制在黎曼超球面的语义驱动优化。我们不依赖复杂的外部解析器,而是直接识别提示中最有影响力的结构词,以有效地路由优化能量。通过严格沿着球形路径更新噪声,我们在数学上保留了原始高斯分布。这种几何约束消除了范数膨胀并释放了激进的步长以实现快速收敛。大量实验表明,Oracle Noise 显着加速了语义对齐,并在无需黑盒模型的情况下实现了卓越的美观性。它完全减轻了欧几里德引起的退化,在人类偏好指标(例如 HPSv2、ImageReward)、语义对齐(CLIP 分数)和样本多样性方面建立了最先进的性能,所有这些都在严格的 2 秒优化预算内。