论文
PoolDINO:以表示池化降低扩散模型生成开销
Pooling Representation Autoencoders for Efficient Diffusion
摘要
表示自动编码器(RAE)根据预先训练的视觉特征生成图像,但其密集的标记网格使得生成建模成本高昂。受局部特征相关性的推动,我们引入了 PoolDINO,这是一种学习仿射池运算符,可以合并相邻标记。与 RGB 解码器联合训练池化算子保留了标准的两阶段 RAE 过程,无需单独的特征自动编码器。在 ImageNet-256 上,4 倍Token压缩在内部指导下保留了可比较的生成质量,而 16 倍压缩则牺牲了一些质量以获得更高的效率。在 100 个采样步骤的固定预算下,潜在采样吞吐量相对于非合并基线分别增加了 3.7 倍和 9.0 倍。分类和密集预测评估表明,可比较的引导生成质量可以与其他任务上较弱的性能共存。