论文
AV-GRPO:用于联合音频视频生成的模态锚定解耦扩散强化学习
AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
摘要
近年来,音视频联合生成取得了重大进展。现有模型仍然受到每种模态保真度有限、文本模态对齐不足以及跨模态同步较弱的问题的困扰。虽然强化学习后训练提供了一种有希望的补救措施,但将其直接适应联合音频视频生成是具有挑战性的。异构的多模式奖励会纠缠学习信号并使学分分配复杂化。考虑到两个模态塔的动力学不同,它们的联合优化在计算上是昂贵的。此外,同步评估难度取决于配对样本,阻碍了公平的奖励比较。我们提出了 AV-GRPO(一种模态锚定的在线扩散强化学习框架)和 5DAV(一种解耦、难度可控的训练数据集)。 AV-GRPO 包括三个关键模块:(1)模态锚定的生成轨迹,以解开学习信号并稳定难度; (2) 轨迹锁定冻结塔优化,以降低成本并重新分配信用; (3) 针对特定模态动力学定制的自适应目标和扰动强度。这将耦合的多模态偏好学习转换为单模态子问题,以实现精确的奖励归因和更好的同步。我们的 5DAV 数据集在五个维度上解耦样本以进行系统训练。 JavisBench 和 VABench 上的实验表明,在 LoRA 和完全微调的情况下,AV-GRPO 在生成质量、语义对齐和跨模态同步方面优于 LTX-2.3。消融证实了我们的设计。代码和数据:这个https URL