论文
我们可以在生成之前预测人类对文本到图像内容的偏好吗?这样做有用吗?
Can We Predict The Human Preference For Text-to-Image Content Prior To Generation And Is It Even Useful To Do So?
摘要
扩散模型 (DM) 通过根据用户提示合成高质量、逼真的视觉内容,彻底改变了文本驱动的生成。 VAE 和 GAN 等视觉生成领域的先前进展主要是根据 FID PSNR 等感知或视觉相似性指标进行评估,而 DM 的进步促进了更先进的人类偏好指标 (HPM) 的发展,该指标将人类判断建模和量化为标量值。然而,DM 使用固有的随机过程来合成内容,其中随机噪声种子生成。初始随机噪声直接影响生成输出的质量,无论是定性还是定量。这种影响在本地部署场景的较小模型中尤为明显。鉴于这种现象,我们首先研究在提交计算资源进行生成之前我们可以在多大程度上预测标量 HPM 分数。此外,我们还研究了在多大程度上可以利用这种预测来提高生成图像的质量,并研究哪些 HPM 最适合这项任务。我们的调查表明,这不仅是可能的,而且实现可以忽略不计的硬件开销也是可行的。