论文

DreOPD:用于流量匹配模型的降级参考外推 同策略 蒸馏

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

摘要

流匹配模型是目前图像生成的主流方法,但其对下游不同场景的适应通常依赖于后训练,这可能会导致特定任务的优化目标之间的冲突。强化学习可以直接优化原始模型之外的特定任务奖励,但轨迹级优化可能会产生高方差梯度和跨任务干扰。 同策略 蒸馏 (OPD) 对学生的展示提供密集且稳定的监督,但传统的教师匹配仍然基于模仿。我们提出了 DreOPD,一种用于连接这两种范式的流量匹配模型的降级参考外推 OPD 方法。我们的 DreOPD 将隐式奖励外推转换为封闭式速度回归,从而实现具有 OPD 稳定性的外推 后训练。它还使用轻度降级的参考来加强教师参考对比,从而产生更清晰的外推方向。单教师和多教师设置的实验表明,DreOPD 在平均性能方面优于 OPD 和多任务 RL 基线,同时在大多数指标上超过了专业教师。