论文

具有 VQA 特定显着性的高保真视频质量评估

High-Fidelity Video Quality Assessment with VQA-Specific Saliency

模型推理推理加速

摘要

无参考视频质量评估(NR VQA)最近在深度学习方面取得了可喜的进展。然而,视频数据本身就很大,用深度模型处理它们会产生很高的计算成本。这一挑战在 VQA 中尤为严峻,其中保留原始分辨率线索和密集的时间信息对于准确性至关重要。现有的效率驱动的预处理策略(例如分段)可以减少计算量,但会改变输入数据的分布,从而限制了预训练视频基础模型 (ViFM) 的有效重用。为了应对这些挑战,我们提出 \textbf{H}igh-\textbf{F}ideity \textbf{V}ideo \textbf{Q}quality \textbf{A}ssessment (\textbf{HFVQA}),这是一个基于固定大小时空 (ST) 补丁构建的框架,与预训练的 ViFM 完全兼容。 HFVQA 对多个尺度的 ST 补丁进行采样,包括原始分辨率,并使用最小的时间子采样来保留低级别的质量线索和语义上下文。为了限制计算,HFVQA 引入了一个使用 ViFM 编码器进行端到端训练的轻量级辅助网络,以学习 \textit{VQA 特定的显着性}。这种显着性直接从质量监督中提炼出来,捕获了特定于任务的重要性模式,反映出视频质量感知由一小部分时空区域主导。通过将高保真时空线索与学习的、特定于任务的显着性相结合,HFVQA 在标准 NR VQA 基准上实现了 SOTA 性能,同时处理少至 12% 的候选 ST 补丁,使基于 ViFM 的高保真 VQA 在计算上易于处理。