论文
印迹在自回归图像生成中是否进行记忆检索?
Does Engram Do Memory Retrieval in Autoregressive Image Generation?
摘要
Engram 模块——一种注入 Transformer 层的哈希键控 O(1) 关联内存——最近被证明可以改进 大语言模型 预训练,其吸引人的解释是它为重复的本地词元模式提供了内容寻址的快捷方式。我们询问这种解释是否会转移到自回归(AR)图像生成,或者观察到的增益(如果有的话)是否来自不同的机制。我们通过 2D 空间 $n$-gram 哈希、门控融合和 KV 缓存兼容增量推理使 Engram 模块适应视觉,并将其注入在 ImageNet 256x256 上训练的类条件 AR 生成器中。纵观主干与内存预算比率 $ρ{\in}[0.17, 0.90]$,每个 Engram 增强变体都跟踪 FID 中的纯 AR 基线,这表明该模块节省了主干 FLOP,但其本身并没有提高样本质量。然后我们探究该模块是如何使用的。门钳扫描表明,完全禁用印迹通路是灾难性的,但是一个微小的恒定门(g=0.10)匹配或击败了学习的门——与大量内容寻址的回忆机制不一致。捐赠者探测实验表明,将散列输入替换为匹配的、对抗性的或随机的同类样本会产生统计上无法区分的下一个标记分布,而折叠或随机化表会使它们降低两到三个数量级。最后,从头开始训练模型,将整个内存表冻结到 $\mathcal{N}(0, 1)$ 噪声,仅花费 $Δ\text{FID}{=}0.10$,并且实际上提高了初始分数。总之,这些发现表明,AR 图像生成中的 Engram 的行为不是内容寻址的 检索器,而是门控架构旁路:哈希键控的残差流,其优势由路径本身主导,学习表仅贡献很小的分布细化。