论文

Q-DeepSight:用图像激励思考,进行图像质量评估和细化

Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement

模型推理推理策略与问题分解

摘要

图像质量评估(IQA)模型越来越多地被用作感知批评家,以指导生成模型和图像恢复。这个角色不仅需要准确的分数,还需要可操作的本地化反馈。然而,当前基于 MLLM 的方法采用单一外观、仅语言范式,这背离了人类寻求证据的判断,并产生了基础薄弱的基本原理,限制了它们在循环细化中的可靠性。我们提出了 Q-DeepSight,一种模拟这种类人过程的图像思考框架。它通过工具增强证据采集(例如裁剪和缩放)执行交错的多模式思想链 (iMCoT),以明确确定质量下降的位置及其原因。为了通过强化学习训练这些长 iMCoT 轨迹,我们引入了两种技术:感知课程奖励(PCR)以减轻奖励稀疏性和证据梯度过滤(EGF)以改善基于视觉的推理的学分分配。 Q-DeepSight 在各种基准上实现了最先进的性能,包括自然、恢复和人工智能生成的内容。此外,我们还通过 Perceptual-in-Generation (PiG) 展示了其实用价值,这是一个 无需训练 框架,其中 Q-DeepSight 的诊断指导迭代图像增强,有效地闭合了评估和细化之间的循环。