论文

Loki:基于扩散的肖像动画的架构表示

Loki: Representation over Architecture for Diffusion-Based Portrait Animation

应用与实践内容创作

摘要

肖像动画将驾驶员剪辑的面部表情和头部姿势转移到单个参考图像上,同时保留参考的身份。最先进的扩散系统通过依次堆叠经过训练的表情、姿势和身份模块来解决这个问题,并通过可训练参数、专有语料库以及系统要独立控制的轴之间的残余纠缠来支付费用。这种复杂性补偿了上游选择——从 RGB 中学习面部表情和头部姿势,在这种表示中,身份、姿势和表情是不可分割的,无需分开学习。 Loki 在调节路径上走出了 RGB。驾驶员表情和头部姿势由人脸模型编码,其参数轴通过构造正交正交,然后光栅化为扩散主干本机消耗的空间图。身份通过轻量级键值注入通过扩散主干网自己的预训练特征单独路由。由于参数表示将表情和姿势中的身份分解,因此交叉 ID 重演减少为推理时的系数替换,不需要交叉 ID 训练数据。 Loki 所需的推理参数比领先的扩散基线少约 43%,并且训练的视频样本少了 1496 倍。我们定义了两个指标,直接测量生成的头部姿势轨迹和面部表情是否遵循驾驶员的——肖像动画实际提出的问题;洛基在这两个方面都担任领导或共同领导。