论文
保守离线训练的悖论:在线适应时反而放大奖励作弊
Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models
摘要
保守离线训练常被认为能为在线适应提供安全起点,因为策略接近已有支持行为,应较少利用奖励模型缺陷。研究对Qwen3-14B设置三种DPO保守程度,β取值来自经验对数比百分位数,再以三个Qwen3-1.7B组成的学习奖励模型集成在线适应,并用GSM8K精确答案准确率测真实表现。三个条件中,离线保守程度越高,按Goodhart差距及其曲线下面积AUGC衡量的奖励作弊损害单调增加,Spearman ρ=1.0。机制分析给出三环链条:较高β压缩策略熵;低熵回答多样性更低,聚集于奖励模型训练分布的狭窄区域;虽然更接近该分布,模型集成的分歧即认知不确定性却随β增加,并在在线优化中更快被利用。论文拟合β与AUGC的幂律关系,确定在对齐忠实性与作弊脆弱性之间取舍的保守程度β*。此结果支持校准保守程度,而非最大化保守程度。