论文

V-Engram:用于模块化文本到图像个性化的触发索引外部存储器

V-Engram: Trigger-Indexed External Memory for Modular Text-to-Image Personalization

应用与实践内容创作

摘要

预训练的文本到图像模型包含广泛的视觉知识,但它们无法仅从少数参考中可靠地获取或细化特定的视觉标识,同时保留构图控制。词元嵌入方法很紧凑,但通常不适合身份,而基于适配器的方法通过持久的权重更新来提高保真度,而在概念构成时,权重更新的存储和干扰成本可能很高。我们引入了 V-Engram,这是稳定扩散 3.5 的触发索引外部记忆机制。每个概念都分配有一个显式触发器,用于检索特定于概念的记忆,其门控方向输入冻结文本编码器和 MMDiT 上下文状态作为相对残差。将这种记忆与骨干适应分离可以实现快速选择性和多概念访问,而无需合并模型更新。实验表明,V-Engram 在整体主题保真度方面与 DreamBooth-LoRA 大致匹配,同时在上下文主题保留等设置中显示出优势。提示匹配加载仅检索匹配的条目,从而减少了单概念查询的大多数额外适应状态加载。定性结果进一步证明了配对触发组合和同类分离,而没有注册条目的提示保留了冻结模型的基本行为。总之,这些结果将触发索引内存建立为模块化接口,用于添加目标视觉证据而无需重写生成器。