论文

DPC-VQA:解耦视频质量评估的质量感知和剩余校准

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

应用与实践结构化分析、预测与决策

摘要

最近的多模态 大语言模型 (MLLM) 在视频质量评估 (VQA) 任务中表现出了良好的性能。然而,由于大规模的再训练和昂贵的平均意见得分(MOS)注释,使它们适应新的场景仍然很昂贵。在本文中,我们认为预训练的 MLLM 已经为 VQA 提供了有用的感知先验,主要挑战是在目标 MOS 空间之前有效地校准它。基于这一见解,我们提出了 DPC-VQA,一种用于视频质量评估的解耦感知和校准框架。具体来说,DPC-VQA 使用冻结的 MLLM 来提供基本质量估计和感知先验,并采用轻量级校准分支来预测目标场景适应的残差校正。这种设计避免了昂贵的端到端再训练,同时以较低的训练和数据成本保持可靠的性能。对用户生成内容 (UGC) 和人工智能生成内容 (AIGC) 基准的大量实验表明,DPC-VQA 相对于代表性基线实现了具有竞争性的性能,同时使用基于 MLLM 的传统 VQA 方法的不到 2% 的可训练参数,并且仅使用 20% 的 MOS 标签保持有效。该代码将在发布后发布。