论文
LL-Bench:重新思考大规模生成模型时代的底层视觉评估
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
摘要
大规模生成模型在图像生成和编辑任务中表现出了卓越的能力。然而,它们在需要像素级控制的底层视觉任务中的性能仍然没有得到充分研究。为了解决这一差距,我们引入了 \textbf{LL-Bench},这是一个全面的 \textbf{Benchmark},用于评估大规模生成模型在 \textbf{L}ow-\textbf{L}evel 视觉任务上的能力。该基准包括 2,469 个真实世界的降级图像,涵盖 16 个底层降级任务,以及由 10 个最先进的大规模生成模型和 21 个传统恢复模型生成的 28,919 个恢复图像,这些图像用 152,020 个专家级成对人类偏好和 28,334 个质量分数进行注释。基于 LL-Bench,我们提出了一种系统诊断,与传统的代表性恢复方法相比,揭示了跨不同底层视觉任务的大规模生成模型的性能边界和独特的故障模式。此外,我们还研究了 LL-Bench 上当前质量评估指标的有效性,该指标与人类评分存在显着差异。为了更好地将恢复图像质量评估与人类偏好结合起来,我们进一步提出了 \textbf{LL-Score},这是一种基于 MLLM 的评估器,可以捕获恢复质量和幻觉的存在。大量实验表明,LL-score 不仅优于现有的图像质量评估指标,而且还可以作为训练底层视觉任务生成模型的有前途的奖励模型。