论文
用于盲图像质量评估的多流视觉语言框架的参数高效适应
Parameter-Efficient Adaptation of a Multi-Stream Vision-Language Framework for Blind Image Quality Assessment
摘要
盲图像质量评估 (BIQA) 可在无需访问原始参考的情况下预测感知图像质量,是图像压缩、传输和恢复等应用的基础。最近的 BIQA 方法越来越依赖于大型视觉语言模型 (VLM)。尽管冻结的 VLM 为计算成本高昂的完整 微调 提供了一种有效的替代方案,但仍不清楚不调整骨干网会牺牲多少性能,更重要的是,在什么条件下这种调整真正有益。然而,由于在合成失真基准上广泛使用图像级分割,回答这个问题变得复杂,其中同一参考图像的失真版本可能出现在训练和测试分区中。这种内容重叠人为地夸大了冻结表示的明显性能,掩盖了它们真正的泛化能力,并可能导致关于主干适应价值的错误结论。因此,我们共同解决这两个问题。我们开发了一个高效的 BIQA 框架,通过轻量级回归头将自然场景统计描述符与冻结的 SigLIP 和 CLIP-H 嵌入融合在一起,然后将参数高效的低秩适应(LoRA)应用于 SigLIP 主干,仅训练 $0.23\%$ 的参数。在图像级和参考级协议下评估六个数据集的冻结和适应模型,我们发现图像级分割使冻结特征 SROCC 膨胀高达 0.44,并掩盖了参考级评估所揭示的真实难度的巨大变化。在这种与内容无关的协议下,LoRA 适应会根据暴露的难度按比例恢复性能,在冻结功能泛化较差的情况下获得最大收益(在 TID2013 上高达 $+0.357$ SROCC),而在功能已经很强大的情况下几乎没有什么好处。