论文

通过 PRISM:视频扩散模型中间状态的偏好表示

Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models

模型训练奖励建模与过程监督

摘要

使用干净的、基于像素的奖励模型评估视频生成会将评估与噪声扩散过程脱节,并产生大量 VAE 解码成本。在本文中,我们通过提出一个基本问题来挑战这一范式:强大的视频生成器能否从本质上直接将偏好与嘈杂的潜伏区区分开来?为了回答这个问题,我们引入\textbf{PRISM}(\textbf{P}参考\textbf{R}在扩散\textbf{M}模型的\textbf{I}nintermediate\textbf{S}状态中的表示)。 PRISM 采用轻量级的基于查询的聚合头和冻结视频扩散主干来解码来自噪声潜伏的偏好信号。令人惊讶的是,PRISM 不仅实现了 SOTA 偏好精度,而且还具有强大的噪声鲁棒性,从而实现了早期 Best-of-$N$ 采样。这允许在去噪的一开始就过滤掉次优的候选者,从而大大减少计算量,同时提高视频质量。我们还揭示了骨干网的生成性能与其固有的评估能力之间存在很强的正相关性,从而实现了视频骨干网的自我改进。