论文

FlowCTS:同策略 流动模型的连续轨迹监控

FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models

摘要

虽然 同策略 蒸馏 (OPD) 有效地解决了 大语言模型 后训练 中的稀疏奖励和暴露偏差,但其对流模型的扩展仍未得到充分探索。为此,我们提出了流连续轨迹监督(FlowCTS),它匹配从同一学生访问状态初始化的后续学生和参考轨迹。利用轨迹和速度场之间的积分关系,我们推导了时间加权速度匹配上限,并将其离散化为由监督步骤数参数化的实际目标。在多参考设置下,单状态 FlowCTS-OPD 的性能优于基于 KL 的普通 OPD,并且收敛速度更快。 FlowCTS-OPD 将 GenEval 从 0.90 提高到 0.93,OCR 从 0.90 提高到 0.92,PickScore 从 22.75 提高到 23.06,同时在所有目标指标上都优于混合奖励 RL 基线。进一步的分析揭示了基于普通 KL 的 OPD 中由于其辅助 SDE 转换内核而产生的明显的时间监督不匹配。除了 同策略 设置之外,FlowCTS 还始终优于普通 SFT,特别是在 OCR 方面,同时增加监督步骤在更丰富的轨迹信息和更大的优化难度之间进行权衡。