论文
OmniNFT:用于联合音频-视频生成的模态全向扩散增强
OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
摘要
联合音频视频生成方面的最新进展非常引人注目,但现实世界的应用需要强大的每种模态保真度、跨模态对齐和细粒度同步。强化学习(RL)提供了一个有前途的范例,但其对多目标和多模式联合音视频生成的扩展仍有待探索。值得注意的是,我们的深入分析首先揭示了应用强化学习的主要障碍源于:(i)多目标优势不一致,即多模式输出的优势在群体内并不总是一致; (ii) 多模态梯度不平衡,其中视频分支梯度泄漏到负责模内生成的浅音频层; (iii) 统一的贡献分配,细粒度的跨模式对齐区域无法得到有效的探索。这些缺点表明,具有单一全局优势的普通 RL 微调 策略通常会导致次优结果。为了应对这些挑战,我们提出了 OmniNFT,一种新颖的模态感知在线扩散 RL 框架,具有三个关键创新:(1)模态优势路由,它将独立的每个奖励优势路由到各自的模态生成分支。 (2)逐层梯度手术,选择性地分离浅音频层上的视频分支梯度,同时保留跨模式交互层的梯度。 (3)区域损失重新加权,调整与音视频同步和细粒度对齐相关的关键区域的策略优化。在具有 LTX-2 主干的 JavisBench 和 VBench 上进行的大量实验表明,OmniNFT 在音频和视频感知质量、跨模态对齐和音视频同步方面实现了全面改进。