论文

流偏好优化中的流形漂移:奖励劫持的一个根源

Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking

模型训练偏好优化

摘要

偏好优化是生成模型的标准对齐方法,但将其扩展到连续时间动力学并非易事。在流匹配中,奖励驱动的更新会修改输运轨迹,而没有对预训练数据流形的固有限制,并可能使终端样本偏离预训练支撑集。我们将这一失败模式形式化为流形漂移。理论上,我们证明最优流匹配会恢复终端数据分布,而当偏好更新诱导的终端位移具有非零法向分量时,它就会离开预训练流形。作为补救,我们提出 ThermoDPO,一种在偏好样本上锚定成对偏好优化的温度受控目标。在不同温度区间上,该目标连接了拒绝采样微调与 FlowDPO,并控制一个逐点的、基于重构的流形距离替代量。为应对低温下信号的减弱,我们进一步引入加权变体 ThermoDPO-weighted。在主要玩具基准上,ThermoDPO-weighted 取得 0.899 的 StrictScore,而 FlowDPO 为 0.629,FlowDPO+RFT 为 0.857。在 SD3.5-M 上 CFG = 4.5 时,它将 OCR 提高 47.5%,四项指标的平均值提高 16.0%。

流偏好优化中的流形漂移:奖励劫持的一个根源:论文配图
图1:FlowDPO(左)与ThermoDPO加权(右)的对比。FlowDPO提升偏好但伴随流形漂移,而ThermoDPO加权在提升偏好的同时保持质量。