论文
利用内在的主题感知注意力来生成可控的多主题视频
Harnessing Intrinsic Subject-Aware Attention for Controllable Multi-Subject Video Generation
摘要
多主题视频生成面临两个关键挑战:不可控的保真度强度和潜在的语义漂移。我们通过分析 Diffusion Transformer (DiTs) 的内部机制来解决这些问题。我们发现某些注意力块自然形成了内在空间定位图(ISGM),可以精确定位参考对象。基于这一见解,我们提出了双阶段内在注意力杠杆(DIAL),这是一个使用这些内部信号进行训练和推理的框架。在低噪声阶段,我们使用 ISGM 来引导注意力机制,从而可以在推理过程中精确控制保真度强度,而无需重新训练。在高噪声阶段,我们使用这些相同的映射自动构建偏好对,无需额外的强化学习(RL)成本。这种强化学习过程有效地将模型的注意力锚定在参考主题上,并减轻了语义漂移。大量实验表明,DIAL 在 OpenS2V-Eval 基准测试中显着优于基准模型,持续提高身份一致性并实现可控的保真度强度。