论文
你的语言模型是它自己的批评者:根据演员的内部状态进行价值估计的强化学习
Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States
摘要
大型推理模型的可验证奖励强化学习 (RLVR) 依赖于方差减少,这需要每个训练批次内有可靠的基线和高提示多样性。这在一般推理模型的多域训练中尤其困难,其中不同任务的提示会产生高度多样化的梯度信号。现有方法在不同方面存在不足:GRPO 将其基线估计为来自同一提示的组平均值,因此准确的基线会在批次中留下更少的不同提示,而 PPO 通过训练策略规模批评家来避免这种权衡,大约使训练成本增加一倍。我们引入 POISE(带有内部状态价值估计的策略优化),这是一种强化学习算法,可将模型的内部状态转化为价值模型。轻量级探针读取前向传播过程中已计算的信号以预测基线,并与策略一起进行在线训练。为了保持梯度无偏性,我们引入了一种交叉采样轨迹结构,可以根据独立采样轨迹的内部状态来预测每个采样轨迹的值。在跨六个领域可验证奖励语料库的 Qwen3-4B 和 OLMo3-7B-Instruct-DPO 上,POISE 优于其他 RLVR 基线,同时实现了更稳定的训练。此外,该探针与单独的 LLM 规模价值模型相匹配,可推广到各种任务,并随着策略规模的变化保持准确。通过利用模型的内部表示,POISE 可以实现稳定的策略优化。