论文

通过注意力头控制扩散 Transformer 中的运动传递

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

模型推理解码与生成控制

摘要

Diffusion Transformer (DiTs) 具有先进的视频生成功能,具有高质量、时间连贯的结果。然而,由于对 DiT 中的运动和结构表示的理解有限,将它们扩展到运动转移(需要在与目标提示对齐的同时跟随参考运动)仍然具有挑战性。我们在注意力头级别分析视频 DiT,并识别专门用于运动和空间结构的不同头。基于这一见解,我们提出了一种无需参数更新的头部感知可控运动传输框架。我们的方法通过语义对应指导来细化来自运动专用头部的运动线索,并通过选择性特征注入保留结构。这种头部控制不仅能够实现精确的运动传输,而且还为使用 DiT 进行可控视频生成提供了可解释的基础。