论文
FLM:用于生成图像压缩的频率感知语言模型
FLM: Frequency-Aware Language Models for Generative Image Compression
摘要
生成模型通过利用学习到的先验,显着提高了低比特率下图像有损压缩的性能上限。然而,生成的纹理和语义细节可能会偏离源内容,从而影响图像重建的保真度。为了解决这些挑战,我们提出了 FLM,一种频率感知语言模型,它通过频域概率建模提高压缩效率,同时保留确定性重建。在编码器处,输入图像被变换为量化的 DCT 系数,这些系数使用基于宏块的系数标记化被组织成离散序列。然后,FLM 执行下一个系数预测,以自回归估计算术编码的 token-wise 条件概率分布,从而生成紧凑的比特流。在解码器处,LLM和算术解码器联合恢复频域数据,然后进行逆变换以进行图像重建。进一步开发了特定于任务的频域数据集和两阶段 微调 策略,以使模型能够跨多个比特率设置运行。 FLM 是一种多功能压缩器,与有损压缩和无损 JPEG 再压缩框架兼容。实验表明,FLM 在率失真性能方面超过了传统的生成有损压缩方法。 FLM 在 Kodak、Tecnick 和 CLIC2020 上分别实现了比 JPEG 基线高 3.30 dB、3.83 dB 和 3.80 dB 的 BD-PSNR 增益。在提高语义高保真度和抑制块效应方面可以实现更好的 FLM 质量。 FLM 还被验证适用于无损再压缩任务,具有具有竞争力的性能。