论文
编辑位,区分代码:视觉自回归模型的按位残差编辑
Edit the Bits, Diff the Codes: Bitwise Residual Editing for Visual Autoregressive Models
摘要
使用视觉自回归 (VAR) 生成器进行文本引导图像编辑需要控制模型采样的内容以及将采样的更改写回图像代码的位置。现有的 VAR 编辑器主要对词元流、特征或平面下一个词元 logits 进行操作,而未充分利用按位残差 VAR 模型的两种本机结构:每比特伯努利预测头和用于组装图像的加性多尺度残差代码字段。我们建议使用 BitResEdit,这是一个用于按位残差 VAR 生成器(例如 Infinity)的 无需训练 编辑器。 BitEdit 通过沿着在共享编辑前缀上计算的源-目标对比倾斜 CFG 后每比特对数赔率来执行源负指导,然后将每个更新投影到干净 CFG 采样器周围的封闭形式 Bernoulli-KL 信任区域中。 ResEdit 将采样位转换为每个尺度的连续代码残差,使用本地化掩码对它们进行门控,并通过生成器的本机尺度和重新注入它们。它们将决策时位指导与组合时代码组合结合在一起,因此通过代码算术准确地保留了屏蔽的潜在特征,同时在目标区域内应用了本地化、规模感知的编辑。在采用 Infinity-2B 的 PIE-Bench 上,BitResEdit 在同主干 VAR 编辑器中实现了最强的文本对齐,与之前最强的编辑器相比,编辑区域的 CLIP 提高了 +1.07,同时保持了背景保留的竞争力。 Ablations 显示 BitEdit 和 ResEdit 在目标对齐和背景保留方面发挥着互补作用。