论文
JLD:通过雅可比矩阵镜头的感知距离
JLD: Perceptual Distance Through A Jacobian Lens
摘要
图像压缩、恢复和生成都需要一种方法来测量两个图像对于一个人来说有多么不同。像素误差忽略了人们的观看方式,而最准确的感知距离通常适合人类的判断,将其与固定的数据和分辨率联系起来。例如,当图像分辨率加倍时,DISTS 与 TID2013 上人类得分的相关性从 0.815 下降到 0.717。我们推出了雅可比矩阵镜头距离 (JLD),它从冻结的视觉编码器而不是人类标签中得出其感知几何形状。 JLD 将早期补丁特征的局部性与后来编码器表示捕获的感知灵敏度结合起来。具体来说,我们使用编码器雅可比矩阵来识别早期特征空间中对编码器输出影响最大的方向,产生固定的度量张量 $E[J^\top J]$,我们将其称为雅可比矩阵透镜。在 100 张未标记的图像中,镜头仅安装一次,大约需要 35 秒。在本地,这种结构定义了像素空间中的回拉度量,为 JLD 提供了清晰的几何解释,可以直接在真实图像上进行分析。在四个标准感知数据库中,JLD 实现了最先进的性能,并始终优于 LPIPS、DISTS、PieAPP 和 DreamSim。 JLD对图像分辨率的变化也具有鲁棒性,在TID2013上,当分辨率加倍时,其透镜项相关性几乎保持不变,仅从0.850下降到0.845。我们进一步引入了 JLD-fast,它比 LPIPS-VGG 快 $4\times$,同时实现了 0.911 的平均相关性。最后,JLD 自然地扩展到视频,在 Waterloo IVC 4K 上达到 0.786 的相关性,而 VMAF 的相关性为 0.611。