论文

ProgressNet:用冻结文生图模型渐进绘画

ProgressNet: Sketching and Prompting with a Frozen Text-to-Image Model

模型推理解码与生成控制

摘要

人类渐进地画画:几笔、看一眼结果、擦掉一笔、修改提示。图像生成器不是这样工作的:它们通常接收完成的草图一次成图,每次编辑都重头再来;而跨轮保持状态的模型由文本驱动、不能接受笔画、且太慢无法边画边看。我们提出ProgressNet——训练自由框架,让冻结文生图模型跟随绘画会话的展开:笔画添加与擦除、提示修订,图像以每轮约一秒的速度跟上。它无需新参数,因为冻结模型已具备渐进生成器所需:上一轮可被记住的通路、能承载外观而不冻结结构的层、以及该多信任未完成草图的内部信号;三个推理时机制(前概念记忆、层选K/V注入、带状自适应控制)依次使用它们。随着草图填充,所有既有方法退化——FS-COCO上FLUX+ControlNet基线的FID在10%到100%完成度间翻倍,而ProgressNet几乎不动;它在三个草图域保持强保真与渐进连贯,用户在五个竞争者中偏好它——最广泛地体现在擦除上。