论文
VAGS:用于图像编辑和生成的速度自适应引导量表
VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation
摘要
无分类器引导 (CFG) 是对文本语义移动基于流的采样器的强度的主要控制,但标准实践在整个 ODE 轨迹上保持其规模固定。这是一个根本性的不匹配:早期的步骤是噪声主导的并且携带微弱的语义信号,而后期的步骤则承诺图像结构并需要更强的方向承诺;更关键的是,任何引导强度的值取决于引导速度是否与模型的当前动态一致或与之相反。我们提出 \textit{速度自适应制导尺度} (VAGS),这是一种 无需训练 替代品,它将标称尺度乘以一个有界因子,该因子结合了时间信号级项与任务相关速度场之间的余弦相似性。对于无反转编辑,VAGS 测量源引导速度和目标引导速度之间的对齐情况,因此每个步骤的编辑强度反映了保存和转换之间的局部兼容性。对于生成,VAGS-Gen 使用无条件和条件速度之间的对齐作为模拟信号。这两种变体都不需要 微调、辅助网络或额外的前向传递,并且固定 CFG 作为特殊情况进行恢复。在 PIE-Bench 和 DIV2K 上进行编辑,在 COCO17、CUB-200 和 Flickr30K 上进行生成,VAGS 相对于固定 CFG 和最新的 无需训练 制导变体不断提高结构保真度和生成质量。该代码可在 https://github.com/Harvard-AI-and-Robotics-Lab/Velocity_Adaptive_Guidance_Scale 上公开获取。