论文

测试时注册为标记化图像生成的全局先验

Test-Time Registers as Global Priors for Tokenized Image Generation

模型推理解码与生成控制

摘要

基于注意力的模型通常会形成注意力池,其中少量词元反复吸引注意力并积累异常大的激活。在视觉 Transformer 中,这些异常值与寄存器密切相关,这些寄存器已在诊断上与全局低频图像结构相关联。现有的工作主要通过可解释性分析和线性探针来研究寄存器,是否可以将它们操作为即插即用信号以无需重新训练即可生成。我们在标记化图像生成中重新讨论这个问题。在 ImageNet 上使用 OpenCLIP 和 DINOv2,我们发现测试时寄存器特征表现出比 [CLS] 读数和补丁均值特征更强的低频集中度,并且与像素空间 DCT 低频能量表现出一致(尽管中等)的相关性。受这些诊断的启发,我们引入了 RegToken,这是一个 无需训练 过程,通过 (i) 基于 NFN 的层定位,(ii) TokenRank 引导的子空间提取,以及 (iii) 寄存器子空间上的投影和守恒更新,将寄存器结构转换为一小组全局先验词元。 RegToken 插入冻结的紧凑型 1D 词元生成管道中,可改进 ImageNet 生成和对齐指标(例如,FID-5k 20.5 至 20.1、SigLIP 3.6 至 3.9),而无需修改预训练权重,并加速测试时间优化(Steps@$τ$ 74 至 52)。总的来说,我们的结果表明,通常被视为注意力工件的结构可以重新用作标记化生成的轻量级全局先验。