论文

PE-OPSD:通过策略自蒸馏将提示增强内部化到流量匹配模型中

PE-OPSD: Internalizing Prompt Enhancement into Flow-matching Models via On-Policy Self-Distillation

摘要

文本到图像的用户通常会提供简洁且不明确的提示,而生成模型则受益于详细的文本条件,以实现可靠的指令遵循。现有系统通过提示增强器 (PE) 弥补了这一差距,在推理时重写原始提示,引入额外的延迟并将提示详细信息留给生成器外部。相反,我们将增强的提示视为特权训练信息,并询问它们的好处是否可以内化。我们提出了用于文本到图像流匹配模型的提示增强on-policy自蒸馏(PE-OPSD)。在训练过程中,原始提示学生遵循自己的生成轨迹,而增强提示教师则在学生访问的状态下提供矢量场目标。这种策略监督将增强提示引起的行为提炼到原始提示学生中,而不需要额外的文本-图像对。在推理时,体育和教师都被删除,学生直接根据原始提示生成。在多个模型系列、PE 和基准中,PE-OPSD 在评估的基线中实现了最强的总体提示保真度,产生积极的总体视觉吸引力收益,并保留了基础模型推理效率。