论文
Tiny-Engram:用于生成视觉的触发器索引概念表
Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision
摘要
当前生成视觉模型的个性化方法通常通过连续适配器或权重更新来编码新概念,但对是否以及何时应检索概念提供有限的控制。在这项工作中,我们引入了 Tiny-Engram,这是一个紧凑的触发器索引概念表,它为视觉记忆提供了明确的词汇地址和冻结图像和视频生成器内的激活边界。 Tiny-Engram 将每个概念参数化为一小组由注册的 n-gram 匹配索引的内存条目,这些条目仅在匹配的触发区域内调制文本编码器隐藏状态。在这个词汇支持之外,调节路径与冻结基础模型的相同。在单编码器潜在扩散和多编码器扩散-Transformer 主干中,该公式将罕见的触发短语与目标身份绑定,同时保留来自周围提示的成分控制。我们进一步在文本条件视频生成设置中评估相同的基于表的内存,其中触发路径可靠地改变生成的主题,但跨保留视频提示的细粒度身份持久性仍然有限。总而言之,这些结果表明,小型、明确解决的概念表是模块化视觉个性化的实用途径,在图像生成方面拥有最有力的证据。对于视频扩散,剩余的差距指向更广泛的要求:时间稳定的身份可能取决于文本侧记忆和不断发展的视觉状态之间更紧密的耦合,从而激发了未来在文本调节接口之外的记忆注入方面的工作。