论文
HyperTransport:T2I 生成模型的摊销调节
HyperTransport: Amortized Conditioning of T2I Generative Models
摘要
随着基础模型能力的增强,有效、可靠地控制其行为的能力变得至关重要。 微调 这些模型可能成本高昂,虽然提示对于可控性来说是实用的,但由于模型对精确提示措辞和结构的高度敏感性,它仍然很脆弱。这种脆弱性引发了人们对激活引导技术的兴趣,这些技术可以对模型行为提供更稳定和可预测的控制。然而,现有的激活引导方法需要针对每个概念进行优化,这使得它们不适合概念集很大、不断变化或仅在请求时指定的部署场景:每个新概念都会对目标模型进行至少几分钟的优化。我们提出了 HyperTransport,一种超网络框架,它通过将预训练编码器(在我们的实例中为 CLIP)的嵌入直接映射到干预参数来分摊此成本,并使用最佳传输损失进行端到端训练。经过训练后,HyperTransport 在单个超网络前向传递中生成每个新的干预,比每个概念拟合快 3600-7000 倍。对于训练期间未见过的概念,它与归纳目标概念时最强的每个概念基线相匹配。通过将概念表示与干预预测解耦,HyperTransport 结合了现有方法无法提供的三种功能:开放式概念集的摊销引导、连续可解释的强度控制以及跨模式调节,其中参考图像可以直接引导基于文本的生成。我们通过基于 CLIP 的指标、VLM 作为法官评估和用户研究,在 167 个测试概念中验证了 DMD2 和 Nitro-1-PixArt 上的 HyperTransport。在成对比较中,人类和 VLM 裁判都更喜欢 HyperTransport,而不是提示频率约为 2 倍。