论文
MAR-MAER:度量感知和模糊自适应自回归图像生成
MAR-MAER: Metric-Aware and Ambiguity-Adaptive Autoregressive Image Generation
摘要
自回归 (AR) 模型在文本到图像生成领域取得了巨大成功。然而,他们通常面临两大挑战。首先,生成的图像可能并不总是符合人类期望的质量标准。此外,这些模型在处理可以用多种有效方式解释的模糊提示时面临困难。为了解决这些问题,我们引入了 MAR-MAER,一种创新的分层自回归框架。它结合了两个主要组件。它是一种度量感知的嵌入正则化方法。另一种是用于处理模糊语义的概率潜在模型。我们的方法利用轻量级投影头,该投影头经过自适应核回归损失函数的训练。这使模型的内部表示与人类首选的质量指标(例如 CLIPScore 和 HPSv2)保持一致。因此,学习到的嵌入空间更准确地反映了人类的判断。我们还引入了条件变分模块。这种方法在分层词元生成过程中结合了受控随机性的一个方面。此功能允许模型根据模糊或开放式提示生成各种连贯图像。我们使用 COCO 和新开发的模糊提示基准进行了广泛的实验。结果表明,MAR-MAER 在度量一致性和语义灵活性方面都取得了优异的性能。它超出了基准 Hi-MAR 模型的性能,CLIPScore 提高了 +1.6,HPSv2 提高了 +5.3。对于不明确的输入,它会产生更广泛的输出。这些发现已通过人工评估和自动化指标得到证实。