论文
自适应奖励路由:通过前向过程 RL 进行联合音频-视频扩散的动态多奖励优化
Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
摘要
多奖励引导强化学习(即 RL)提供了一种有前途的方法,可以沿着几个互补的目标改进联合音视频扩散模型,包括模态特定质量、跨模态语义对齐和时间同步。然而,它的有效性取决于训练期间变化的两个量:奖励驱动的更新应该在哪里起作用,以及竞争奖励应该如何组合。现有的方法往往依赖于固定的路由和奖励权重,无法跟踪不断发展的模型功能。为了解决这些限制,我们提出了自适应奖励路由,以在联合音视频扩散模型的前向处理 RL(即 DiffusionNFT)期间联合调整更新位置和奖励协调。我们的方法由两个部分组成。 (i) 跨模态影响引导路由(本地化更新):我们使用双向交叉注意力响应作为进化跨模态影响的有效代理,动态地重新加权词元感知损失并跨跨模态层缩放梯度,而无需额外的模型干预。 (ii) 偏好保留模态感知重新加权(协调奖励):我们保留预定义的权重作为偏好先验,并使用特定于分支的奖励梯度交互作为预热后的剩余校正。这可以解决不断演变的冲突,而不会让主导性奖励抑制较弱但重要的目标。大量实验表明,在强大的 RL 基线上,模态质量、语义一致性和音视频同步得到了持续改进。消融和机制分析进一步验证了自适应更新路由和奖励协调的互补优势。