论文

第一阶段初始化改变策略熵,却未显著改善最终推理结果

Stage-1 Controls the Entropy Regime, Not the Outcome

模型评测模型行为与机制分析

摘要

研究以Qwen2.5-VL-7B及同模态72B教师模型比较两阶段后训练中的三种初始化,探究监督微调或同策略蒸馏后再强化学习时,第一阶段究竟改变什么。三种初始化在Geometry3K内部验证上均处于53%–54%的窄区间,未显示明显的域内最终收益。采用匹配训练配方并提前停止的SFT,在域外MathVista上提高2.1个百分点,扭转过度训练版本下降9.5个百分点的情况。最明显的差异在策略熵:OPD进入强化学习时的熵高于两种SFT初始化,且差异在可观察训练轨迹中持续存在。域内初始化时,OPD答案多样性更高,pass@16比SFT高2.0–5.2个百分点,但较小差异的问题级自助法区间仍不确定。强化学习后,这一优势消失,最终pass@16相差不超过1.1个百分点,MathVista六个模型相差不超过1.2个百分点。因此,结果主要说明第一阶段与策略熵状态相关,并未证明OPD是更好的强化学习初始化。