论文
RefReward-SR:偏好对齐超分辨率的 LR 条件奖励建模
RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution
摘要
生成超分辨率(SR)的最新进展极大地提高了视觉真实感,但现有的评估和优化框架仍然与人类感知不一致。全参考和无参考指标通常无法反映感知偏好,要么由于像素未对齐而惩罚语义上合理的细节,要么有利于视觉上清晰但不一致的伪像。此外,大多数SR方法依赖于真值(GT)相关的分布匹配,这并不一定符合人类的判断。在这项工作中,我们提出了 RefReward-SR,一种用于偏好对齐 SR 的低分辨率 (LR) 参考感知奖励模型。 RefReward-SR 不依赖 GT 监督或 NR 评估,而是根据 LR 输入评估高分辨率 (HR) 重建,将 LR 图像视为语义锚。利用多模态 大语言模型 (MLLM) 的视觉语言先验,它以推理感知的方式评估语义一致性和合理性。为了支持这种范式,我们构建了 RefSR-18K,这是第一个大规模 LR 条件偏好的 SR 数据集,提供基于 LR-HR 一致性和 HR 自然性的成对排名。我们使用 LR 条件排名奖励通过组相对策略优化(GRPO)对 MLLM 进行微调,并进一步将 GRPO 集成到 SR 模型训练 中,并以 RefReward-SR 作为偏好对齐生成的核心奖励信号。大量的实验表明,我们的框架与人类的判断实现了更好的一致性,产生了保持语义一致性的重建,同时增强了感知的合理性和视觉的自然度。代码、模型和数据集将在论文被接受后发布。