论文

Any-OPD:通过表示空间桥接实现流匹配模型的异构 同策略 蒸馏

Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging

摘要

同策略 蒸馏,其中教师纠正学生自己生成的样本,预设两个模型使用相同的语言:相同的 VAE 潜伏、匹配的架构和共同的时间步网格。我们问,当这一切都不成立时,会发生什么,就像当最强的教师和希望部署的学生来自不同的模型系列时,我们发现标准配方没有答案:教师潜伏不能作为外部坐标系中的目标,随机重新绘制局部细节的教师的每像素损失会退化为模糊或发散,时间步长索引在不匹配的时间表中失去意义。据我们所知,我们提出了 Any-OPD,这是任意潜在流匹配生成器对之间的 同策略 蒸馏 的第一个框架。 Any-OPD 将教师纯粹视为黑盒采样器,并在一个点上连接两个模型:一种冻结的、与模型无关的视觉表示,其中比较它们独立解码的输出,回避关于潜在特征、特征或架构的每一个假设。通过匹配连续噪声水平而不是步长索引来恢复轨迹对应关系,并且短暂的锚定阶段(其中通过学生自己的 VAE 重新编码教师样本)确保 同策略 梯度测量样本质量而不是域失配。 Any-OPD 将 12B FLUX.1-dev 提炼为 2.5B SD3.5-Medium,将学生的 PickScore 从 0.846 提升到 0.884,将 HPSv3 从 9.12 提升到 10.97,与教师的大小相媲美,而教师的大小是直接潜在回归根本无法训练的五分之一。