论文

Flow-OPD:同策略 蒸馏 用于流量匹配模型

Flow-OPD: On-Policy Distillation for Flow Matching Models

摘要

现有的流匹配(FM)文本到图像模型在多任务对齐下面临两个关键瓶颈:标量值奖励引起的奖励稀疏性,以及联合优化异构目标引起的梯度干扰,它们共同产生了竞争指标和普遍存在的 奖励作弊 的“跷跷板效应”。受到 同策略 蒸馏 (OPD) 在 大语言模型 社区中成功的启发,我们提出了 Flow-OPD,这是第一个将 同策略 蒸馏 集成到流匹配模型中的统一 后训练 框架。 Flow-OPD采用两阶段对齐策略:首先通过单一奖励GRPO 微调培养领域专业教师模型,让每个专家孤立地达到其绩效天花板;然后,它通过基于流程的冷启动方案建立强大的初始策略,并通过 同策略 采样、任务路由标签和密集轨迹级监督的三步编排将异构专业知识无缝地整合到单个学生中。我们进一步介绍了流形锚正则化(MAR),它利用与任务无关的教师来提供完整的数据监督,将生成锚定到高质量的流形,有效地减轻在纯强化学习驱动的对齐中常见的美学退化。 Flow-OPD 基于 Stable Diffusion 3.5 Medium 构建,将 GenEval 分数从 63 提高到 92,OCR 准确度从 59 提高到 94,比普通 GRPO 整体提高了大约 10 个点,同时保留了图像保真度和人类偏好对齐,并表现出一种新兴的“超越教师”效果。这些结果将 Flow-OPD 确立为用于构建通用文本到图像模型的可扩展对齐范例。代码和权重将发布在:https://github.com/CostaliyA/Flow-OPD。