论文

LLaVA-Assessor:为视觉质量评估构建 LMM 基础

LLaVA-Assessor: Building the Foundation LMM For Visual Quality Assessment

模型训练监督微调与指令调优

摘要

在感知和评估视觉信号质量方面与人类视觉系统(HVS)保持一致是基于机器视觉的视觉质量评估系统的核心目标。随着大型多模态模型(LMM)的快速发展,视觉问答为构建多模态和多任务场景下视觉质量评估的统一基础模型提供了一个有前途的范例。受到基于 HVS 的质量评估中经典“感知-决策”过程的启发,我们将基于 LMM 的机器视觉的视觉质量评估制定为两个互补的任务:“质量解释”和“质量评分”。围绕这些目标,我们提出了LLaVA-Assessor,一个统一的数据构建和模型训练系统。为了支持多模态输入,我们设计了一种自适应模型架构,可以高效处理图像和视频。对于数据构建,我们开发了严格的人工注释协议和新颖的机器合成主导的数据扩展管道,以构建大规模、高质量的数据集。此外,我们引入了一种简单而有效的即时解缠策略,以减轻多任务学习中训练目标的混乱,从而实现稳定和连贯的联合训练。由此产生的一体化 LMM LLaVA-Assessor-GIGA 在 11 美元的图像/视频质量评分测试集和 4 个视觉质量解释基准上实现了卓越的性能。大量结果证明了集成结构化数据构建、自适应模型设计和多任务联合训练对于自动化视觉质量评估的有效性。我们的工作为开发用于自动视觉质量评估的基础 LMM 提供了令人信服的见解。项目页面位于此 https URL。