论文

HPSD:用于文本-图像-视频扩散模型的混合策略 Self-蒸馏

HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

摘要

文本图像到视频 (TI2V) 模型是一种新兴的统一架构,其中单个模型同时支持文本到视频 (T2V) 和图像到视频 (I2V) 的生成。给定高质量的第一帧或详细的文本提示,TI2V 模型可以解锁比 T2V 模式更好的视觉质量,这就提出了一个自然的问题:这种特权条件引发的能力是否可以内化到模型自身的基础生成能力中?实现此目标的常见方法是模型 self-蒸馏。然而,最直接的解决方案,受监督的 微调,遵循 离策略 策略:其监督仅限于来自固定离线分布的教师生成的端点,而不是学生访问的状态,缺乏针对不断发展的政策的精确修正。最近的 同策略 蒸馏 方法反而遭受条件状态不匹配的困扰,其中监督被引导到给定的第一帧而不是学生的实际内容,从而误导了纠正。为了实现吸收教师特权先验的 self-蒸馏,同时保留精确的策略修正,在这项工作中,我们提出了混合策略 Self-蒸馏 (HPSD),这是一种新颖的 self-蒸馏 框架,其中单个 TI2V 模型在不同条件下充当教师和学生:教师在 TI2V 模式下运行,具有高质量的第一帧和增强的提示,而学生则在 TI2V 模式下运行。在基本 T2V 模式下运行,仅带有普通提示符。具体来说,学生继承 离策略 教师轨迹点作为锚点,根据自己的策略进行局部细化,并最终接受对这些自行生成的推出的速度级别监督。大量实验表明,HPSD 显着提高了 T2V 性能,同时还带来了显着的 TI2V 增益,有效增强了模型的基础生成能力。