论文
无多模态注意力的门控条件注入:走向可控线性注意力 Transformer
Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers
摘要
基于扩散的可控视觉生成的最新进展导致图像质量显着提高。然而,由于计算量大,这些强大的模型通常部署在云服务器上,引发了对用户数据隐私的严重担忧。为了实现安全高效的设备上生成,我们在本文中探索了基于线性注意力架构的可控扩散模型,即使在边缘设备上,它也能提供卓越的可扩展性和效率。然而,我们的实验表明,现有的可控生成框架(例如 ControlNet 和 OminiControl)要么缺乏支持多种异构条件类型的灵活性,要么在此类线性注意力模型上收敛缓慢。为了解决这些限制,我们提出了一种专为 SANA 等线性注意力主干量身定制的新型可控扩散框架。我们方法的核心在于在双路径管道中工作的统一门控调节模块,它有效地集成了多类型条件输入,例如空间对齐和非对齐线索。对多个任务和基准的大量实验表明,我们的方法基于线性注意力模型实现了最先进的可控生成性能,在保真度和可控性方面超越了现有方法。