论文
使用心理物理数据评估用于图像质量评估的视觉语言模型
Evaluating Vision-Language Models for Image Quality Assessment using Psychophysical Data
摘要
心理物理学实验仍然是感知图像质量评估(IQA)最可靠的方法,但其成本和有限的可扩展性激发了自动化替代方案。本文研究了视觉语言模型 (VLM) 是否可以帮助评估感知图像外观和质量。我们引入了一个受心理物理学启发的框架,通过对比度、色彩度和整体偏好的受控成对图像比较来探测 VLM 感知灵敏度。将六个 VLM(四个专有模型和两个开放权重模型)与心理物理学数据进行比较。结果揭示了强烈的属性依赖性变异性:Claude 表现出最高的内部一致性,而 GPT 的整体偏好达到了最强的一致性。 Claude 和 Qwen 在色彩方面表现出最强的一致性,而 Qwen 在对比度方面表现最好。然而,没有一个模型能够在所有属性上始终符合人类的感知。高度的自我一致性并不一定意味着感知的有效性,当渲染之间的感知差异更加明显时,VLM(人类一致性)通常会提高。