论文

超越骨骼:使用 Same2X 训练策略直接从驾驶视频中学习动画

Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy

模型推理解码与生成控制

摘要

人体图像动画旨在从静态参考图像生成视频,并以从驾驶视频中提取的姿势信息为指导。现有方法通常依赖姿态估计器来提取中间表示,但此类信号在遮挡或复杂姿态下容易出错。基于这些观察,我们提出了 DirectAnimator,这是一个绕过姿势提取并直接从原始驾驶视频中学习的框架。我们引入了由姿势、面部和位置提示组成的驾驶提示三元组,以语义丰富但稳定的形式捕获运动、表情和对齐,并通过 CueFusion DiT 块将它们融合,以便在去噪期间进行可靠控制。为了在驾驶身份和参考身份不同时使学习变得可靠,我们设计了 Same2X 训练策略,将跨 ID 特征与从相同 ID 数据中学习到的特征对齐,从而规范优化并加速收敛。大量实验表明,DirectAnimator 实现了最先进的视觉质量和身份保留,同时对遮挡和复杂的清晰度保持鲁棒性,并且只需更少的计算资源即可实现。我们的项目页面位于 https://directanimator.github.io/。