论文
锚定策略优化:通过支撑约束矫正缓解探索坍缩
Anchored Policy Optimization: Mitigating Exploration Collapse Via Support-Constrained Rectification
摘要
可验证奖励强化学习(RLVR)日益被视为一种树剪枝机制。然而,我们发现一种被称为递归空间收缩(RSC)的系统性病理:一种由正向锐化与负向挤压共同驱动、使有效备选方案的采样概率趋于消失的不可逆坍缩。虽然Kullback-Leibler(KL)正则化旨在缓解这一问题,但它施加了刚性的形状匹配(Shape Matching)约束,迫使策略模仿参考模型的完整密度,与正确性所需的锐化形成梯度冲突。我们提出锚定策略优化(APO),将范式从全局形状匹配转向支撑覆盖。通过基于参考模型的高置信支撑定义安全流形,APO允许为效率而激进锐化,同时在纠错期间选择性地调用恢复力以防止坍缩。我们从理论上推导出APO是一种梯度对齐的机制,可最大化支撑覆盖,从而实现使有效分支重新膨胀的弹性恢复(Elastic Recovery)。在数学基准上的实证评估表明,APO打破了精度-多样性权衡,在显著提高Pass@1的同时,恢复了标准策略梯度方法通常会丧失的Pass@K多样性。
