论文
从过度训练理解RLVR中的推理多样性收缩
Understanding Diversity Collapse in RLVR via the Lens of Overtraining
摘要
RLVR可增强推理,但常出现多样性收缩:pass@1提升,高k的pass@k下降。研究从过度训练解释这一现象:当一个问题对参考指标的贡献已饱和,继续更新不再扩大可解决范围,却会把概率集中到同策略采样偏好的轨迹。每题仅少量采样时,一次成功就可能使高k指标接近饱和,因此很多更新从能力边界角度看属于过度训练。RLVR结构上不利于高k的pass@k,故其总体下降并不等于没有新增推理能力。干预实验只更新尚未观察到成功的问题,使困难基准上的pass@256超过基础模型;标准训练中也有部分原本不可解的问题变得可解。贝叶斯边界门控(BBG)估计每个问题对推理边界的边际贡献,使优化避开过度训练,在多个基准和广泛k值上提高平均pass@k。