论文
Diffusion-APO:视频扩散的轨迹感知直接偏好对齐 Transformer
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
摘要
有效地将大规模视频传播模型与人类意图保持一致需要一个可扩展且轨迹感知的路径,以弥合训练噪声分布和实际推理轨迹之间的固有差异。虽然直接偏好优化 (DPO) 和组相对策略优化 (GRPO) 等现有范式试图解决这个问题,但它们常常因依赖容易出现偏差的复杂奖励模型或次优时间步采样而受到阻碍。在本文中,我们提出了 Diffusion-APO(对齐偏好优化),这是一种轨迹感知算法,通过将训练噪声与推理时间去噪路径同步来解决这种不对齐问题,从而最大限度地提高梯度信号功效。为了将这种算法创新转化为实际的解决方案,我们引入了统一、模块化的 RLHF 框架,该框架集成了在线排名、半在线锚定、离线细化和 蒸馏 感知漂移校正。该框架可以跨不同数据和计算约束实现灵活的多阶段偏好调整,而无需依赖基于标量奖励的策略梯度。通过大量实验,我们证明 Diffusion-APO 在视觉质量和指令遵循方面始终优于标准基线,同时在模型加速过程中有效保持生成保真度,为可扩展视频扩散对齐提供强大的端到端路径。