论文
DistortBench:图像畸变识别的视觉语言模型基准测试
DistortBench: Benchmarking Vision Language Models on Image Distortion Identification
摘要
视觉语言模型 (VLM) 越来越多地用于对低级图像退化敏感的环境,包括内容审核、图像恢复和质量监控。然而,人们对它们识别失真类型和严重程度的能力仍然知之甚少。我们推出 DistortBench,这是 VLM 中无参考失真感知的诊断基准。 DistortBench 包含 13,500 个四选题,涵盖 27 种畸变类型、6 个感知类别和 5 个严重级别:25 个畸变继承了 KADID-10k 校准,而另外两个添加的旋转畸变则使用基于单调角度的级别。我们评估了 18 个 VLM,包括来自 5 个系列的 17 个开放权重模型和一个专有模型。尽管在高级视觉语言任务上表现强劲,但最佳模型仅达到 61.9% 的准确率,略低于人类多数投票基线 65.7%(平均个人:60.2%),表明底层感知理解仍然是当前 VLM 的主要弱点。我们的分析进一步揭示了模型大小的弱和非单调缩放、大多数基础思维对的性能下降以及模型系列中不同的严重性响应模式。我们希望 DistortBench 能够成为测量和改善 VLM 低级视觉感知的有用基准。