论文
通过解开影响函数完善多维视频奖励模型
Refining Multidimensional Video Reward Models via Disentangled Influence Functions
摘要
随着文本到视频 (T2V) 生成模型的不断发展,视频评估的复杂性需要跨各个轴进行细粒度的评估。为了解决这个问题,最近的工作重点是开发多维视频奖励模型(MVRM),它分解评估过程以更好地符合人类视觉感知的多方面性质。然而,训练有效的 MVRM 从根本上受到视频数据复杂性的挑战。在这项工作中,我们发现了一种称为维度异质性的关键现象:训练样本的可靠性在不同的评估维度上可能会有很大差异,这意味着样本可能为一个目标提供可靠的监督,同时为另一个目标带来高监督风险。因此,基于全局标量指标进行过滤的流行的以数据为中心的方法不适用于 T2V 任务。为了解决这个问题,我们提出了一个解开的影响框架,可以有效地估计特定维度的监管风险。利用这个框架,我们引入了两种维度解缠的细化策略:维度解缠剪枝(Dimension-Disentangled Pruning),它去除了极高风险的样本;维度解缠重重加权(Dimension-Disentangled Reweighting),它温和地降低了高风险监督的权重。大量实验表明,我们的解缠结策略显着优于全局过滤基线,产生的奖励模型与 真值 具有出色的一致性。