论文

锚定策略优化:通过支撑约束矫正缓解探索坍缩

Anchored Policy Optimization: Mitigating Exploration Collapse Via Support-Constrained Rectification

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)日益被视为一种树剪枝机制。然而,我们发现一种被称为递归空间收缩(RSC)的系统性病理:一种由正向锐化与负向挤压共同驱动、使有效备选方案的采样概率趋于消失的不可逆坍缩。虽然Kullback-Leibler(KL)正则化旨在缓解这一问题,但它施加了刚性的形状匹配(Shape Matching)约束,迫使策略模仿参考模型的完整密度,与正确性所需的锐化形成梯度冲突。我们提出锚定策略优化(APO),将范式从全局形状匹配转向支撑覆盖。通过基于参考模型的高置信支撑定义安全流形,APO允许为效率而激进锐化,同时在纠错期间选择性地调用恢复力以防止坍缩。我们从理论上推导出APO是一种梯度对齐的机制,可最大化支撑覆盖,从而实现使有效分支重新膨胀的弹性恢复(Elastic Recovery)。在数学基准上的实证评估表明,APO打破了精度-多样性权衡,在显著提高Pass@1的同时,恢复了标准策略梯度方法通常会丧失的Pass@K多样性。

锚定策略优化:通过支撑约束矫正缓解探索坍缩
图3:纠错动态的比较。(左) 不可逆剪枝:在标准RLVR中,挤压效应(Squeezing Effect)导致出错时盲目的质量再分配,使备选分支永久坍缩(置灰显示)。(右) 通过APO实现的弹性恢复:当被锐化的路径遇到错误(红叉)时,我们修正比率中的拉力项(Pull Term)起到恢复力的作用。它重新激活由参考先验导出的Anchor Set(发亮的蓝色节点),使agent能够“回溯”并探索先前被抑制的有效备选路径(实心蓝色箭头)。