论文

IQA-Spider:将多粒度图像质量评估与推理、基础和参考相结合

IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring

模型评测基准与评测资源

摘要

我们提出了 IQA-Spider,这是第一个图像质量评估 (IQA) 框架,它将推理、基础和引用统一到一个基于 LMM 的框架中,以实现多粒度质量理解。现有的基于 LMM 的 IQA 方法通常仅支持部分感知维度,例如质量描述和问题回答(\textit{i.e.,推理)或像素级基础。这种限制很大程度上源于缺乏(i)统一的任务和数据公式以及(ii)多粒度学习的有效优化范例。为了解决这些限制,我们制定了严格的四任务范例,涵盖全局和局部质量描述、像素级像素定位和区域级引用。基于这个公式,我们构建了相应的具有可扩展和自动注释管道的IQA数据集,从而为统一的多粒度学习提供了坚实的基础。为了进一步实现统一感知,我们采用无冲突的两阶段设计,逐步将文本级多粒度理解扩展到像素级基础:(i)第一阶段为模型配备跨多个 IQA 任务的细粒度文本级推理,(ii)第二阶段引入 无需训练 文本到点基础范式,通过将标记 logits 映射到文本语义和像素级感知来桥接文本语义和像素级感知。空间坐标。基于这些努力,我们实现了具有统一多粒度可解释图像质量评估的IQA-Spider。跨多个基准的广泛实验证明了强大的性能,验证了所提出的公式和框架的有效性和多功能性。