论文
从一瞥到仔细:细粒度图像质量评估的渐进式失真推理
From Glance to Scrutiny: Progressive Distortion Reasoning for Fine-Grained Image Quality Assessment
摘要
多模态 大语言模型 (MLLM) 通过将视觉感知与描述性评估联系起来,在图像质量评估 (IQA) 方面展现出巨大的潜力。然而,现有方法主要侧重于整体质量预测,通常充当黑匣子,无法深入了解失真发生的位置以及它们如何影响感知质量,从而阻碍了对局部和异质退化的细粒度分析。我们提出了 GS-IQA,这是一个框架,它将 IQA 重新表述为一种渐进的“哪里-什么-如何”诊断,模拟人类从最初的一瞥到仔细审查的感知过程。由于严重性判断仅对正确定位和识别的区域才有意义,因此我们通过尊重此类依赖性的两阶段强化学习范例来实现这一进展:扫视阶段使用感知门控奖励来确定退化所在的位置和性质,只有在两者都正确时才激活严重性反馈,而审查阶段引入在线奖励条件退化生成来合成针对模型感知瓶颈的硬示例,从而增强其对细微严重性变化的辨别力。为了实现系统评估,我们构建了 Diag-Bench,这是一个区域级 IQA 基准,包含约 25K 个精选样本,涵盖 12 种失真类型和 5 个顺序严重性级别。大量实验表明,GS-IQA 在失真定位、识别和严重性估计方面始终超越最先进的方法,并且其诊断表示可以有效地转移到跨不同外部基准的传统全局质量预测。代码和数据将被发布。