论文
SyncDPO:通过偏好学习增强视频音频联合生成中的时间同步
SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning
摘要
视频-音频联合生成的最新进展在语义对应方面取得了显着的成功。然而,实现精确的时间同步仍然是一个具有挑战性的问题,这需要音频事件与其视觉触发器之间的细粒度对齐。用于联合生成的 后训练 方法主要由监督 微调 主导,但常用的均方误差损失对细微的时间错位提供了足够的惩罚。直接偏好优化提供了一种替代方案,通过引入显式未对齐的对应项来更好地提高时间敏感性。在本文中,我们提出了 后训练 框架 SyncDPO,利用 DPO 来提高 V-A 联合生成的时间敏感性。传统的 DPO 管道通常依赖于昂贵的采样和排序过程来构建偏好对,从而导致大量的计算成本。为了提高效率,我们引入了一套基于实时规则的负构造策略,该策略可以扭曲时间结构,而无需进行额外的注释或采样。我们证明,通过时间扭曲的 V-A 对提供显式的负监督,可以有效地增强时间对齐能力。因此,我们实施了一种课程学习策略,逐步增加负样本的难度,从粗略的错位过渡到微妙的不一致。从环境声音视频到人类语音视频等四个不同基准的广泛客观和主观实验表明,SyncDPO 在提高模型时间对齐能力方面显着优于其他方法。它还通过捕获内在的运动声音动力学,展示了对分布外基准的卓越泛化。演示和代码可在 https://syncdpo.github.io/syncdpo/ 中找到。