论文

生成困难在哪里?目标表示的实证研究

Where Does Generative Difficulty Reside? An Empirical Study of Target Representations

模型评测模型行为与机制分析

摘要

目标表示定义了图像生成器必须学习的分布,但它通常被视为可互换的接口。对于连续屏蔽生成器来说,这种假设尤其值得怀疑,连续屏蔽生成器将可见标记的上下文推断与每个缺失标记的条件建模结合起来。我们在统一的掩码自回归整流流模型中研究原始像素、SD-VAE 潜伏和 DINOv2 以及 MAE 表示自动编码器特征。在共享 ImageNet 训练预算下,这些空间表现出独特的优化和推理机制。 DINOv2 在迭代和计算方面收敛速度最快,但受益于更广泛的局部降噪器和直接上下文融合。像素优化速度要慢得多,并且需要不同的预测、掩蔽和引导配置。 MAE 更忠实地重建图像并表现出清晰的语义聚类,但产生的生成比 DINOv2 差得多。这些表示对无分类器指导的响应也不同,并且具有不同的精确率与召回率权衡。总之,我们的结果表明,压缩、重建保真度、标记维度和可见语义聚类不能单独预测生成行为。相反,目标表示在上下文建模、每个标记去噪和推理时间分布控制之间重新分配难度。