论文

Poly-OPD:用于能力可选流模型的异构多教师 同策略 蒸馏

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

摘要

领先的开放式文本到图像模型通常具有互补的优势:一个可能会引领符合偏好的美学,而另一个则更忠实地遵循构图指令。然而,它们的自动编码器和噪声调度的差异使得很难在模型之间转移这些优势。在本文中,我们提出了 Poly-OPD,这是一个框架,可以将异质教师的互补优势整合到一个紧凑的流程匹配学生中。为了弥合不同教师不兼容的潜在空间,Poly-OPD 通过像素桥执行 同策略 蒸馏。每个学生生成的图像都由选定的教师编码器重新编码,并根据教师噪声计划下的幅度匹配的噪声水平进行细化。由此产生的目标进一步与冻结 DINOv2 空间中的学生相匹配,从而能够对不兼容的潜在空间进行监督。为了保留互补功能而不会出现教师之间的干扰,Poly-OPD 使用梯度兼容性诊断来组织其适配器:注意力 LoRA 模块在教师之间共享,而前馈适配器仍然是教师特定的。在蒸馏期间,差距意识课程将更多的训练投入到学生仍然低于老师的作文类别上。随着每个差距的缩小,训练会转向剩余差距较大的类别。通过将 FLUX.1-dev 和 Z-Image 提炼为 2.5B SD3.5-Medium 学生,Poly-OPD 将 GenEval 从 67.3 提高到 73.3,超越了两个较大的教师,并将 DrawBench HPSv3 从 9.34 提高到 11.35,将这两种优势整合到一个可切换模型中。