论文

使用大型多模态模型进行 UGC 图像中的视觉失真检测

Visual Distortion Detection in UGC Images Using Large Multimodal Models

应用与实践视觉感知与空间理解

摘要

感知质量的局部描述长期以来一直是图像质量评估(IQA)中的一个关键但尚未充分探索的挑战。基于大型多模态模型 (LMM) 的现有方法主要依赖于文本驱动的监督 微调 (SFT)。然而,这种训练范例在检测精度方面表现出明显的局限性。此外,通常用作主要训练数据源的综合扭曲图像在部署到现实场景中时表现出显着的泛化差距;因此,\textbf{合成到真实(\textit{S2A})}问题代表了一个严峻的挑战。受这些问题的启发,我们提出 \textbf{\textit{VIGIL}},它利用 LMM 架构进行精确的视觉失真检测。从超过 1000K 样本的候选池中,我们构建了 \textbf{\textit{VIGIL-140K}} 训练集,其中包含超过 140K 的扭曲图像。这些图像是通过严格的质量过滤和精心设计的失真注入获得的,涵盖8个主要的合成失真类别。我们的模型利用 大语言模型 (LLM) 解码器的不同层,将它们视为 \textit{多个检测器},使用多级特征执行同步失真检测。此外,我们保留了分配给非失真类的预测的失真线索,这有助于减轻 \textit{S2A} 问题中常见的模糊前景-背景 (\textit{FG-BG}) 分离。经过后处理后,我们的模型在域内合成失真检测和 \textit{S2A} 任务上始终优于强大的基线。