论文

KL 正则化 RLVR 的参考采样玻尔兹曼投影:目标匹配加权 SFT、有限单次间隙和策略镜像下降

Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent

模型训练强化学习

摘要

具有可验证奖励的在线强化学习 (RLVR) 将可检查的结果转变为可扩展的训练信号,但它使采样轨迹生成、验证者评分和参考策略评估保持在优化路径上。预先采样的轨迹上的静态加权监督 微调 (SFT) 似乎消除了这个瓶颈,但加权可能性并不仅仅由奖励指定:它的采样器和权重导致策略拟合。本文确定了参考采样加权 SFT 目标,其诱导策略等于固定参考 KL 正则化 RLVR 优化器。优化器是标准的玻尔兹曼目标策略,通过验证者奖励对参考策略进行指数倾斜而获得。将加权 SFT 诱导策略与该目标相匹配会强制密度比权重;在参考采样子类中,这唯一地减少到提示缩放,提示归一化玻尔兹曼权重 $\exp(r(x,y)/β)/Z(x)$。 BOLT 是一种玻尔兹曼目标 SFT 程序,是该投影的经验估计器。有限一次性分析将精确的存储支持价格 $β\log(1/π^*(S_N\mid x))$ 与分区估计、有效样本大小方差、泛化、优化和近似误差分开。这种分解解释了为什么额外的 SFT 历元无法修复缺失的参考策略覆盖范围,并暴露了温度-覆盖范围-方差边界。当覆盖范围需要自适应采样时,刷新的玻尔兹曼预测变成KL策略镜像下降;有限内部求解作为精确镜像步骤的附加漂移输入。单次运行 Qwen 实验为规定的单次运行范围内的目标匹配权重、一次性饱和度、刷新采样器增益和优化时间节省提供了预测证据。