论文
DreamLite:用于图像生成和编辑的轻量级设备上统一模型
DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing
摘要
扩散模型在文本到图像(T2I)生成和文本引导图像编辑方面都取得了重大进展。然而,这些模型通常是用数十亿个参数构建的,导致高延迟和增加的部署挑战。虽然设备上扩散模型提高了效率,但它们主要关注 T2I 生成,缺乏对图像编辑的支持。在本文中,我们提出了 DreamLite,一种紧凑的统一设备上扩散模型 (0.39B),支持单个网络内的 T2I 生成和文本引导图像编辑。 DreamLite 建立在经过修剪的移动 U-Net 主干上,并通过潜在空间中的上下文空间串联来统一调节。它水平连接图像作为输入,使用(目标 | 空白)配置进行生成任务,使用(目标 | 源)配置进行编辑任务。为了稳定这个紧凑模型的训练,我们引入了一种任务渐进式联合预训练策略,该策略依次针对 T2I、编辑和联合任务。经过高质量的 SFT 和强化学习后,DreamLite 在图像生成方面达到了 GenEval (0.72),在图像编辑方面达到了 ImgEdit (4.11),超越了现有的设备端模型,并与多个服务器端模型保持了竞争力。通过采用步骤 蒸馏,我们进一步将去噪处理减少到仅 4 个步骤,使我们的 DreamLite 可以在小米 14 智能手机上在不到 1 秒的时间内生成或编辑 1024 x 1024 图像。据我们所知,DreamLite 是第一个支持图像生成和图像编辑的统一设备上扩散模型。