论文

AesRM:通过专家级反馈提高视频美感

AesRM: Improving Video Aesthetics with Expert-Level Feedback

模型训练奖励建模与过程监督

摘要

尽管逼真的视频生成技术取得了快速进步,但电影制作等现实世界的应用需要超出视觉保真度的视频美学,例如和谐的色彩和电影照明。先前关于视觉美学的工作主要集中在图像上,常常将美学简化为粗略的定义,例如视觉愉悦,而没有进行严格和系统的评估。为了提高视频美学,我们提出了一个分层标准,将视频美学分解为三个核心维度:视觉美学(VA)、视觉保真度(VF)和视觉合理性(VP),并具有 15 个细粒度标准,例如镜头构图。该框架支持大规模专家注释的偏好数据集和评估基准 AesVideo-Bench,其中包含约 2500 个视频对,并带有 VA、VF 和 VP 的专家注释。然后,我们构建了一系列视频审美奖励模型 (AesRM):AesRM-Base,它直接预测这些维度上的成对偏好,以提供高效的 后训练 奖励;AesRM-CoT,它另外生成与所有 15 个标准一致的 CoT,以提高评估的可解释性。具体来说,我们通过三阶段渐进方案来训练AesRM:(1)原子审美能力学习,加强AesRM对基本美学概念的识别,例如准确识别中心构图; (2) 冷启动,使模型与结构化推理协议保持一致; (3)GRPO,进一步提高评估精度。为了增强 AesRM-CoT,我们还提出了基于自一致性的 CoT 合成,以提高 CoT 质量并在 GRPO 期间设计基于 CoT 的流程奖励。大量实验表明,AesRM 在多个美学基准上的表现优于基准,并且更稳健,位置偏差更低。最后,我们将 Wan2.2 与 AesRM 结合起来,并观察到相对于现有的审美奖励模型有明显的审美收益。