论文

人类图像动画的隐式偏好对齐

Implicit Preference Alignment for Human Image Animation

模型训练偏好优化

摘要

人类图像动画已经取得了重大进步,但由于其高自由度和运动复杂性,生成高保真手部动作仍然是一个持续的挑战。虽然根据人类反馈进行强化学习,特别是直接偏好优化,提供了一种潜在的解决方案,但它需要构建严格的偏好对。然而,为动态手部区域策划这样的对是非常昂贵的,并且由于帧间的不一致而常常是不切实际的。在本文中,我们提出了隐式偏好对齐(IPA),这是一种数据高效的 后训练 框架,消除了对配对偏好数据的需要。从理论上讲,基于隐式奖励最大化,IPA 通过最大化自我生成高质量样本的可能性来调整模型,同时惩罚与预训练先验的偏差。此外,我们引入了手部感知局部优化机制,以明确地将对齐过程引导至手部区域。实验表明,我们的方法实现了有效的偏好优化,提高了手牌生成质量,同时显着降低了构建偏好数据的障碍。代码发布于 https://github.com/mdswyz/IPA