论文
重新思考极低比特率下的生成图像压缩
Rethinking Generative Image Compression at Extremely Low Bitrates
摘要
生成图像压缩以低比特率产生视觉上合理的重建,但当比特率接近零时,它们的行为在很大程度上仍未被探索。当低于正常运行速率时,代表性编解码器会经历语义崩溃:它们不会优雅地丢失特定于源的细节,而是会产生格式错误或无法识别的内容。我们的分析确定了两个因素。随着比特率降低,重建损失与梯度和视觉结果上的语义目标越来越冲突,而像素空间和面向重建的 VAE 扩散模型在语义保留方面变得效率较低。在这些发现的指导下,我们引入了 RAE-CoD,这是一种构建在表示自动编码器 (RAE) 空间中的面向压缩的扩散 (CoD),可在压缩表示和源表示之间直接对齐,为 256\times256$ 图像保留可识别的、自然结构化的内容,只需 16 位。我们使用五个视觉基础模型(VFM)和盲视觉语言模型协议来评估该框架。在 MSCOCO-30K 上,RAE-CoD 从所有评估中脱颖而出。在 0.001-0.008 bpp 时,与最佳竞争对手相比,它将相对 VFM 特征 MSE 和 Fréchet Distance 比率降低了至少 25.7% 和 69.1%。与此同时,语义可识别性和重建质量几乎保持不变,而源一致性则平稳下降,用向无条件生成的优雅过渡取代了突然的语义崩溃。代码将在https://github.com/LuizScarlet/RAE-CoD.发布