论文
CodecArena:通过视觉强化学习进行编解码器质量评估
CodecArena: Codec Quality Assessment via Visual Reinforcement Learning
摘要
在端到端编解码器的推动下,视频编码正在进入低比特率和超低比特率状态,这些编解码器用联合优化的神经网络和利用视频生成模型先验的生成编解码器取代了手工制作的管道。然而,主要的指标 LPIPS 和 DISTS 衡量的是特征和纹理相似性,而不是内容保真度:幻觉错误的面孔或将文本模糊为令人信服的笔画的重建仍然可以得分很高,即使人类立即拒绝它。为了解决这个问题,我们提出了 CodecArena,这是第一个用于视频编码质量评估的视觉语言框架,将编解码器评估作为参考与其重建之间的源条件比较推理。我们使用 Facet-GRPO 优化 CodecArena,这是一种视觉强化学习方案,可调整成对编解码器偏好,同时将判决基于五个保真度方面:身份、对象、文本、纹理和时间一致性。其刻面锚定奖励使用自动派生的刻面方向作为弱锚点,而不是人类的每个刻面标签,以防止任何单个子分数主导整体偏好,并产生可解释的细粒度质量判断。为了支持这个尚未开发的体系中的训练和评估,我们构建了两个互补资源:CodecArena-1K,一个由 1,500 个比较组组成的全自动偏好数据集,由传统、神经和生成编解码器重建以及融合视觉语言和客观监督构建而成; CodecArena-Bench,一个人工排名的基准,具有源不相交的视频,用于公平的域外评估。大量实验表明,CodecArena 在不同编解码器和比特率下对源不相交内容的判断与人类的判断达到了最先进的一致,超越了感知指标和先前的视觉语言评估器。