论文

VA-Judger:根据人类偏好反馈进行奖励建模,用于联合视频音频生成

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

模型训练奖励建模与过程监督

摘要

使用强化学习来后训练联合视频音频生成模型需要奖励信号。现有方法通过结合各个质量维度的指标来构建这种奖励,包括音频质量、视觉保真度和同步。然而,这些指标单独评估感知维度,无法捕捉塑造人类偏好的文本提示、视频和音频之间的整体语义和时间连贯性。针对这些指标优化模型会鼓励 奖励作弊,生成在这些指标上获得高分的视频音频内容,但对人类观众来说却显得不连贯或不忠实。为了解决这个问题,我们首先构建了一个用于联合视频音频生成的大规模人类偏好数据集 VAPref-10K,其中包括来自生成模型的 9K 提示和 10.3K 细粒度配对比较。我们还引入了 VA-Judger-Bench 基准,通过域内和域外模型比较来评估奖励模型是否真正符合人类偏好。我们进一步提出 VA-Judger,一种用于联合视频音频生成的思想链全方位奖励模型。特别是,VA-Judger 首先从具有明显质量差距的配对中学习,以建立结构化输出和粗略偏好辨别,然后通过针对人类注释验证的拒绝采样,提取可靠的偏好解释,以进行更难的近质量比较,最后执行维度强化学习,将人类反馈分解为个体质量维度,以获得比单个二元偏好标签更密集的奖励信号。实验表明,VA-Judger 在预测人类偏好的域内和域外评估方面均优于度量基线。使用 后训练 音频视频生成模型的人性化奖励也可以显着提高生成质量。