论文
MeanFlowAdvantage:少步平均速度生成器的稳定奖励微调
MeanFlowAdvantage: Stable Reward Fine-Tuning for Few-Step Average-Velocity Generators
摘要
MeanFlow 通过预测间隔平均速度实现高效的几步生成,但这种表示会导致奖励微调的不匹配:现有的基于优势的目标通常是在瞬时速度或等效的 $x_0$ 空间预测上定义的,而推理直接使用学习的平均速度图。我们引入了 MeanFlowAdvantage,这是一种用于平均速度生成器的带符号优势加权最小二乘目标。我们的关键结构使用共享的、独立的 MeanFlow 导数校正来表达预测空间中的奖励目标,同时对推理中部署的平均速度网络进行rollout和参考正则化精确惩罚。由此产生的公式保留了 MeanFlow 的原生少步采样器,并提供了一种将奖励改进转移到已部署的流程图的直接机制。在 SD3.5-Medium 上,MeanFlowAdvantage 在匹配的四步 MeanFlowNFT 基线上改进了所有八个报告指标,并且仅使用四个 NFE,在八个指标中的六个指标上匹配或超过了 40 步 DiffusionNFT 基线。同样的目标也转移到 DNA 启动子设计中,它支持在流形上定义的生成器的无教师on-policy RL 和教师指导的奖励分级蒸馏,后者在比较配置中产生最低的一步 Sei 剖面 MSE。